Google DeepMind представила Gemini Robotics 2 для полнотелого управления роботами

Google DeepMind представила семейство моделей Gemini Robotics 2, которое позволяет гуманоидным и двуручным роботам планировать многоэтапные задания, управлять всем телом и совместно выполнять работу. Модель рассуждения Gemini Robotics ER 2 уже доступна в Google AI Studio, а управляющие модели VLA пока предоставляются партнёрам раннего доступа.

Гуманоидный робот под управлением Gemini Robotics 2 взаимодействует с лейкой

Исследовательское подразделение Google DeepMind представило семейство Gemini Robotics 2 из трёх моделей. Основная модель «зрение — язык — действие» (VLA) преобразует визуальные данные и команды в движения робота, Gemini Robotics ER 2 отвечает за рассуждение и планирование, а Gemini Robotics On-Device 2 предназначена для локальной работы на устройствах.

Gemini Robotics 2 может управлять всем телом гуманоидного робота: ходьбой, наклонами, балансировкой и манипуляциями с предметами. В демонстрациях модель управляла роботом Apptronik Apollo 2, пяти­пальцевыми кистями SharpaWave и двуручной платформой Franka Duo.

Gemini Robotics ER 2 способна разбивать команды на последовательности продолжительностью несколько минут, отслеживать выполнение, повторять неудавшиеся действия и координировать несколько роботов. Локальную On-Device 2 можно адаптировать к новой двуручной платформе за несколько часов, обычно используя менее 200 примеров.

Многопальцевые манипуляции пока остаются нестабильными: в испытаниях успешность отвинчивания лампочки составила 92%, закручивания — 36%, а завязывания мусорного пакета — 44%. Для оценки рисков Google DeepMind также выпустила тест ASIMOV-Agentic, проверяющий способность системы отклонять опасные действия и обращаться к человеку при неопределённости.

Gemini Robotics ER 2 доступна в Google AI Studio и в закрытой предварительной версии Gemini Enterprise Agent Platform. Модели VLA и On-Device предоставляются партнёрам по программе раннего доступа.

Источник: deepmind.google

Связь с редакцией