World Labs представила нейросетевую модель нового поколения — Atlas. Она может генерировать изображения и видео с управлением камерой на основе одного или нескольких входных изображений, а также выполнять сложные задачи трёхмерной пространственной реконструкции и пространственно-временного моделирования. 

Согласно официальному описанию, Atlas является предварительно обученным мультимодальным авторегрессионным диффузионным трансформером, который изначально поддерживает различные типы данных, включая текст, изображения, видео, положения камеры и 3D-карты глубины. Все входные данные вводятся в общий «пространственный контекст», из которого модель генерирует последующий контент, сохраняя при этом согласованность с видимым контентом в 3D-пространстве.

Модель может выполнять четыре основные задачи: генерацию с управлением камерой, пространственную реконструкцию, пространственно-временное моделирование и генерацию изображений. В частности, генерация с управлением камерой позволяет создавать новые ракурсы на основе одного или нескольких эталонных изображений, задавая произвольные положения и углы камеры, и выводить видео продолжительностью до одной минуты в разрешении 1440p. В отличие от моделей, которые полагаются на текстовые описания движений камеры, Atlas использует точную геометрию камеры в качестве исходных данных, обеспечивая точность на уровне отдельных пикселей.

Что касается пространственной реконструкции, Atlas может восстанавливать реалистичные сцены из одного и нескольких входных изображений, генерируя новые изображения с перспективой в качественной трёхмерной сцене. Официальные спецификации указывают на то, что модель превосходит модели, специально разработанные для 3D-реконструкции, по результатам множества сравнительных тестов. Например, ее средняя абсолютная относительная ошибка (AbsRel×10⁻³) на семи стандартных наборах данных, включая DTU, ETH3D, KITTI и ScanNet, составляет 8,6, что ниже, чем у сопоставимых моделей, таких как Pi3X (11,1) и Depth Anything 3 (11,9).

Atlas поддерживает вывод облаков точек или трёхмерных гауссовых диаграмм. На основе видео, снятого на телефон, модель может предсказать глубину каждого кадра и объединить их в полную трёхмерную сцену, заполняя области, которые не были запечатлены.

Что касается пространственно-временного моделирования, Atlas может восстанавливать видеоматериалы с трёх-пяти смартфонов или камер с датчиками движения в многоракурсные кадры в режиме «замедленной съёмки», что позволяет осуществлять кадрирование видео.

Несмотря на моделирование мира как основную задачу, Atlas также обладает возможностями генерации изображений, включая 360-градусные панорамы, следуя сложным текстовым подсказкам, и поддерживает различные визуальные стили.

В контексте масштабируемости World Labs заявила, что производительность Atlas значительно улучшается с увеличением вычислительных ресурсов для обучения. Экспериментальные результаты показывают, что в задачах генерации, управляемых камерой, Atlas достиг уровня предпочтения человеческой оценки от 75% до 94% по сравнению с такими моделями, как MiniMax H3, Gemini Omni Flash, Happy Horse 1.1, FLUX 3 и Seedance 2.5.

В настоящее время Atlas находится на стадии раннего доступа и доступа избранным партнёрам. В будущем модель будет интегрируют в новые версии платформы Marble от World Labs. Разработчики могут подать заявку на пробное использование через официальные каналы и ознакомиться с подробной демо-страницей

Не пропускайте важнейшие новости о дополненной и виртуальной реальности — подписывайтесь на Голографику в Телеграме, Максе, ВК и X! Поддержите проект на Бусти.

Далее: Приложение XR Replay поможет записать на видео пропущенные игровые моменты