24.07.2026
NVIDIA представила ModelExpress — систему доставки весов и других артефактов больших языковых моделей из наиболее быстрого доступного источника. Она может передавать данные напрямую между GPU через RDMA, а при отсутствии готовой реплики — загружать их из объектного или локального хранилища.
NVIDIA представила ModelExpress (MX) — систему, сокращающую время холодного запуска и масштабирования сервисов инференса больших языковых моделей. Перед загрузкой ModelExpress ищет совместимую копию весов и выбирает наиболее быстрый доступный маршрут к памяти GPU.

Если другая реплика уже обслуживает ту же модель, веса передаются непосредственно между GPU по P2P RDMA с помощью библиотеки NVIDIA Inference Xfer Library (NIXL). Это позволяет обойти повторное обращение к объектному хранилищу, локальным дискам и оперативной памяти узла. При отсутствии подходящей реплики MX может потоково читать файлы safetensors из объектного хранилища или загружать их с локального накопителя, в том числе через GPUDirect Storage.
Управляющий уровень обнаруживает совместимые источники через Redis или метаданные Kubernetes. Система также координирует однократную загрузку общей копии модели в кластерный кеш и умеет передавать между репликами кеши скомпилированных ядер. Заявлены интеграции с vLLM и SGLang, а также поддержка платформ NVIDIA Dynamo и llm-d.

По данным NVIDIA, в испытании с DeepSeek-V4 Pro на узле с восемью ускорителями B200 и сетевыми адаптерами ConnectX-7 передача весов и кешей JIT-ядер из работающей реплики заняла менее 10 секунд. Общее время запуска сократилось с восьми минут до одной минуты 44 секунд.
Источник: developer.nvidia.com