10.09.2026
Модель S1 осваивает ранее не заданные многоэтапные операции по одной видеодемонстрации — без изменения весов и дополнительного обучения. Skild AI показала задачи продолжительностью до десяти минут и заявила о семикратном преимуществе над системой, получавшей текстовые команды, но сравнение основано на внутренних тестах.
Разработчик универсальных систем управления роботами Skild AI представил фундаментальную модель S1. Она получает видеозапись демонстрации в качестве контекстного запроса, определяет цель и последовательность действий, а затем переводит их в команды для робота без дообучения под конкретную задачу.

В демонстрациях S1 выполняла ранее не встречавшиеся ей операции продолжительностью до десяти минут: пересаживала растение, готовила блины, заваривала кофе и комплектовала наборы. В эксперименте с пересадкой растения между записью примера и началом автономного выполнения прошло 11 минут.
По данным Skild AI, во внутреннем тесте на новых многоэтапных задачах показатель успешности S1 достиг 66% против 9% у сопоставимой модели класса vision-language-action, получавшей текстовые команды. Компания также оценила одну видеодемонстрацию как эквивалент примерно 380 примерам, собранным оператором для последующего обучения. Независимая проверка этих результатов не приводится.
S1 обучалась на вычислительной инфраструктуре NVIDIA с применением моделей Cosmos и средств моделирования Omniverse, Isaac Sim и Isaac Lab. NVIDIA также сообщила, что вместе со Skild AI и Foxconn внедряет систему Skild Brain на двуручных манипуляторах для сборки вычислительных систем Blackwell.
Источник: skild.ai