World Labs представила модель Atlas для генерации, реконструкции и симуляции 3D-миров

Atlas объединяет в одной модели генерацию видео с управляемой камерой, восстановление трехмерных сцен и создание симуляций. Система принимает текст, изображения, видео и пространственные данные, а результат может экспортировать как облака точек и сцены 3D Gaussian Splatting.

Компания World Labs, основанная исследовательницей компьютерного зрения Фэй-Фэй Ли и ее коллегами, представила Atlas — единую модель для генерации, реконструкции и симуляции трехмерных миров. Разработчики называют ее мультимодальным авторегрессионным диффузионным трансформером: входные изображения, видео, положения камер и карты глубины объединяются в общий пространственный контекст.

Atlas генерирует новые ракурсы сцены по одному или нескольким изображениям, принимая траекторию камеры как геометрические данные. Модель способна создавать управляемые видеоролики продолжительностью до минуты с разрешением 1440p.

Для реконструкции реальных объектов и помещений Atlas может использовать от одного до нескольких десятков снимков. По утверждению World Labs, двух-трех изображений обычно достаточно для достоверного восстановления видимых частей сцены, а дополнительные кадры уменьшают объем деталей, которые модели приходится достраивать самостоятельно.

Результат можно получить не только в виде изображений или видео, но и как облако точек либо сцену на основе 3D Gaussian Splatting. В робототехнических сценариях Atlas реконструирует окружение и генерирует цветные изображения и карты глубины, которые получили бы датчики виртуального робота. Это позволяет создавать обучающие и тестовые симуляции с разными объектами, освещением и траекториями движения.

Atlas пока предоставляется отдельным партнерам в режиме раннего доступа. В дальнейшем модель станет основой новых версий продукта World Labs Marble и других сервисов компании.

Источник: worldlabs.ai

Связь с редакцией