01.08.2026
NVIDIA опубликовала рекомендации по совместному проектированию механизма внимания и схемы распараллеливания для ускорения инференса моделей с длинным контекстом. Компания предлагает отдельно учитывать узкие места обработки входного контекста и генерации токенов, а также согласовывать архитектуру модели с особенностями GPU.
NVIDIA представила технический разбор влияния параметров механизма внимания на производительность инференса. По измерениям компании для DeepSeek-R1, при увеличении входного контекста с 4 тыс. до 128 тыс. токенов доля внимания во времени обработки промпта возрастает с 18% до 85%.

Авторы разделяют инференс на обработку входного контекста, или prefill, и последовательную генерацию токенов, или decode. Первый этап преимущественно ограничен вычислительной производительностью и для плотного внимания масштабируется квадратично с длиной контекста. Второй зависит главным образом от пропускной способности памяти при чтении кеша ключей и значений (KV-кеша), а его стоимость растет линейно.
NVIDIA сформулировала четыре рекомендации:
Анализ ориентирован на GPU NVIDIA и сочетает расчеты форм матричных операций с измерениями ядер, использующих формат FP8 для вычисления внимания и хранения KV-кеша.
Источник: developer.nvidia.com