21.07.2026
NVIDIA опубликовала техническое описание GPU Rubin — основы вычислительной платформы Vera Rubin для крупномасштабного ИИ-инференса. Ускоритель получил 336 млрд транзисторов, 224 потоковых мультипроцессора, 896 тензорных ядер и до 288 Гбайт памяти HBM4.
GPU Rubin состоит из двух крупных вычислительных кристаллов, соединённых внутри корпуса высокоскоростным интерфейсом NV-HBI. Тензорные ядра и Transformer Engine третьего поколения обеспечивают до 50 петафлопс производительности в низкоразрядном формате NVFP4.

Подсистема памяти включает до 288 Гбайт HBM4 с пиковой пропускной способностью 22 Тбайт/с — в 2,8 раза больше, чем у Blackwell и Blackwell Ultra с HBM3e. Для связи с другими компонентами предусмотрены NVLink 6 с пропускной способностью до 3,6 Тбайт/с, когерентный интерфейс CPU—GPU NVLink-C2C на 1,8 Тбайт/с и PCI Express 6.0 x16 на 256 Гбайт/с.

Среди архитектурных изменений NVIDIA выделяет обновлённый Tensor Memory Accelerator для моделей типа mixture of experts, удвоенную производительность тензорных операций по измерению K, аппаратную поддержку разреженных активаций и более точную синхронизацию зависимых ядер. Эти механизмы должны сокращать задержки при обработке длинного контекста и распределённом инференсе.
По оценке NVIDIA, стоечная система Vera Rubin NVL72 обеспечивает до десятикратного роста производительности агентных ИИ-нагрузок на единицу энергии по сравнению с Blackwell. Сравнение основано на внутреннем тесте компании с MoE-моделью на 2 трлн параметров. Подробности приведены в техническом обзоре архитектуры Rubin.
Источник: developer.nvidia.com