15.09.2026
NVIDIA раскрыла механизмы защиты NVLink 6 от сбоев на физических соединениях, сетевом, системном и программном уровнях. Технология предназначена для крупных вычислительных комплексов, где отказ одного соединения или узла может остановить распределённое обучение или инференс ИИ-моделей.
NVIDIA описала архитектуру отказоустойчивости NVLink 6 — высокоскоростной системы соединений для ускорителей. Она применяется в стоечной платформе Vera Rubin NVL72, объединяющей 72 графических процессора Rubin в общий вычислительный домен.

На физическом уровне NVLink 6 сочетает прямое исправление ошибок (FEC), повтор передачи пакетов и восстановление физического интерфейса. На канальном уровне управление потоком по кредитам позволяет отправлять пакет только при наличии места в буфере следующего узла, а при деградации соединений система автоматически перераспределяет трафик.
Контроллер NMX может изолировать неисправное соединение и вывести из него трафик перед восстановлением. Управляющие функции переносятся на резервный контроллер, при этом перезапуск управляющего процессора или операционной системы коммутатора не должен останавливать передачу данных.
На программном уровне механизм Shadow Engine Recovery в платформе инференса NVIDIA Dynamo поддерживает заранее подготовленную копию рабочего процесса. В испытании NVIDIA на ускорителях B200 это сократило восстановление обслуживания после потери одного из двух процессов с 283 до 7,3 секунды.

Библиотека коллективных коммуникаций NVIDIA NCCL также получила прототип поддержки многоузловых контрольных точек CUDA. Общедоступный выпуск этой функции компания ожидает до конца 2026 года.
Источник: developer.nvidia.com