Новые разделы!
ИИ, квантовые вычисления и много других интересных тем
22.09.2026
NVIDIA представила открытый инструментарий Topograph, который обнаруживает физическую топологию вычислительных кластеров и передает эти сведения системам управления нагрузкой. Проект поддерживает Kubernetes и Slurm, помогая размещать компоненты распределенных задач в близких сетевых доменах.
NVIDIA представила Topograph — открытый инструментарий для планирования GPU-нагрузок с учетом физической топологии вычислительного кластера.
Topograph получает данные из API облачных платформ или локальных сетевых систем, включая InfiniBand, Spectrum-X и домены Multi-Node NVLink. Затем он преобразует сведения в общую модель и формирует данные для планировщиков: метки узлов Kubernetes, конфигурации топологии Slurm, ресурсы Node Feature Discovery, ConfigMap для Slinky или граф в формате JSON.
Инструмент может обновлять представление топологии при изменениях в кластере. В Kubernetes его можно установить с помощью Helm, а для Slurm предусмотрено создание конфигураций topology/tree и topology/block, в том числе отдельных топологий для разделов кластера.
Исходный код Topograph опубликован под лицензией Apache 2.0. Репозиторий содержит Helm-чарт, контейнерный образ, средства сборки пакетов DEB и RPM, а также модели для тестирования без производственного оборудования.
Источник: developer.nvidia.com