Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

Reka AI объединила текст, изображения, видео и управление роботами в модели Rho-1

Компания Reka AI представила исследовательскую версию Rho-1 — модели с 19 млрд параметров, которая работает с текстом, изображениями, видео и управляющими действиями роботов в рамках одной нейросети. Общий контекст позволяет модели создавать и редактировать сцены, анализировать результаты и формировать действия без обращения к внешним специализированным моделям.

Разработчик ИИ-моделей Reka AI представил исследовательскую версию Rho-1 с 19 млрд параметров. Модель понимает и генерирует текст, изображения и видео, а также формирует управляющие действия для роботов.

Демонстрация Rho-1 с генерацией сцены и выделением объекта

Текст и команды в Rho-1 кодируются дискретными токенами, а изображения, видео, действия и данные о состоянии робота — непрерывными. Потоки понимания и генерации используют общее внимание и единый KV-кеш, поэтому созданные ранее сцены и полученные инструкции сохраняются в контексте одного диалога.

В демонстрациях Rho-1 генерирует изображение, находит на нём объект, превращает сцену в видео, редактирует ролик по новой команде и объясняет внесённые изменения. Та же архитектура применена к робототехнике: модель прогнозирует будущие кадры с камер и одновременно выдаёт управляющие сигналы.

По данным Reka AI, контрольная версия была обучена с нуля на 320 ускорителях Nvidia H100 примерно за три месяца. Компания называет Rho-1 прототипом, а не готовым продуктом: разрешение видео пока ограничено 672×384 пикселями, длинные генерации теряют структурную согласованность, отслеживание объектов во времени и точечное редактирование остаются нестабильными.

Источник: reka.ai

Связь с редакцией