Пространственное понимание
С момента основания World Labs развивает идею «пространственного интеллекта»: ИИ должен понимать трёхмерное пространство примерно так же, как человек. Atlas стала первой моделью компании, рассчитанной на эту задачу в большом масштабе.
Модель работает не только с плоскими изображениями или короткими видеоклипами. Она учитывает, как выглядит сцена с разных сторон и как она меняется со временем.
World Labs называет Atlas мультимодальной моделью, обученной с нуля на текстах, изображениях, видео и 3D-данных. Каждый входной фрагмент привязывается к определённой позиции в трёхмерном пространстве, а не обрабатывается как часть плоской последовательности. Это общее пространственное представление компания называет «пространственным контекстом» — именно его Atlas использует при создании новых кадров и ракурсов.
По словам World Labs, такая привязка отличает модель от систем, работающих только с языком или видео.
Фэй-Фэй Ли описывала эту проблему в эссе, опубликованном в ноябре 2025 года. Современные мультимодальные языковые модели и модели диффузии для видео разбивают данные на одномерные или двумерные последовательности, из-за чего даже простые пространственные задачи становятся неоправданно сложными. Для них нужны архитектуры, в которых токенизация, контекст и память учитывают трёхмерное или четырёхмерное пространство.
Управление камерой
В режиме генерации с управляемой камерой Atlas принимает одно или несколько изображений и создаёт новые виды с выбранных пользователем позиций и углов. Движение камеры задаётся напрямую через геометрию, а не описывается текстовым запросом, как это часто происходит в видеомоделях.
Модель генерирует видео длительностью до одной минуты в разрешении 1440p. Пользователь может самостоятельно контролировать каждый кадр и каждый ракурс, а не получать случайный результат.
Восстановление сцен
Для пространственной реконструкции Atlas восстанавливает реальные сцены по одному или нескольким десяткам фотографий, причём специальное оборудование для съёмки не требуется. Чем больше изображений получает модель, тем меньше ей приходится дополнять сцену на основе собственных знаний.
По данным World Labs, уже двух или трёх фотографий достаточно для точного результата, который превосходит специализированные 3D-модели. При этом Atlas может обрабатывать более 100 входных изображений. В одной демонстрации модель постепенно собирала Главный двор Стэнфорда по наземным фотографиям — от двух до 25 снимков — и затем создавала виды кампуса с высоты.
Atlas принимает исходное изображение и заданную траекторию камеры в качестве геометрического входа и генерирует соответствующий новый ракурс
Источник: the-decoder.com
Именно при заметном перемещении камеры многие существующие системы начинают проваливаться. В сравнении на платформе OpenWorldLib модели вроде VGGT и InfiniteVGGT быстро показывали геометрические несоответствия и размытые текстуры.
Atlas выдаёт результат в виде настоящих 3D-данных, а не только изображения или видео: модель обрабатывает глубину вместе с цветовой информацией RGB. Среди поддерживаемых форматов — точечные облака и 3D-гауссовы сплаты. Они описывают сцену множеством небольших пространственных точек, которую можно плавно рассматривать с любого ракурса. Такой формат используется и в существующем продукте World Labs Marble.
По одной фотографии, сделанной на уровне улицы, Atlas генерирует виды с воздуха, снятые высоко над городом
Источник: the-decoder.com
Источник: the-decoder.com
Симуляция
Atlas одновременно моделирует пространство и время. По видео, снятому всего несколькими камерами, модель способна создавать эффект «нулевого времени»: сцена как будто замирает, а пользователь получает возможность рассматривать её с ракурсов, недоступных при обычной съёмке. В демонстрации использовались несколько смартфонов и камер для съёмки в движении, а не профессиональное оборудование.
Обучение роботов
Для робототехники Atlas выступает инструментом перехода от реального мира к симуляции. Модель восстанавливает комнату и генерирует изображения и данные о глубине, которые увидели бы датчики виртуального робота на его маршруте.
По нескольким фотографиям можно создавать разные варианты задач на захват и перемещение, меняя:
Так World Labs рассчитывает получать разнообразные данные для обучения роботов, не снимая каждую возможную ситуацию в реальном мире.
Помимо изображений, Atlas также выдаёт сцены в виде явных 3D-данных — здесь они представлены как облако точек с соответствующей траекторией камеры
Источник: the-decoder.com
В августе 2026 года World Labs показала этот подход в виде отдельного продукта — движка «реальный мир — симуляция — реальный мир». Он создаёт тысячи вариантов одной задачи из реального мира и обучает модели управления полностью в симуляции. По данным компании, на пяти роботизированных платформах модели работали по часу без вмешательства человека.
Технология пришла из компании SceniX, которую World Labs приобрела в июле.
Дополнительные возможности
Генерация изображений по тексту не является основной задачей Atlas. При этом модель умеет следовать сложным запросам, отрисовывать текст, создавать разные визуальные стили и формировать панорамы на 360 градусов.
Atlas объединяет подходы языковых и видеомоделей. Она создаёт результат поэтапно, как языковая модель, поэтому может использовать те же методы ускорения, включая кэширование KV. Одновременно Atlas применяет принцип диффузии из моделей изображений и видео: постепенно очищает результат от шума. Благодаря этому ей доступны методы, которые сокращают процесс удаления шума или повышают качество изображения.
Источник: the-decoder.com
Результаты испытаний
World Labs считает, что одной метрики недостаточно, чтобы описать возможности Atlas, и ссылается на два набора испытаний: генерацию с управляемой камерой и реконструкцию 3D-сцен по небольшому числу ракурсов. В обоих случаях Atlas, по данным компании, опережает более специализированные модели.
В испытаниях с управляемой камерой внешние оценщики предпочитали результат Atlas в следующих сравнениях:
В реконструкции Atlas показала медианную ошибку 25,3, опередив Pi3X и VGGT-Ω 1B.
В прямых сравнительных тестах генерации с управлением камерой большинство оценщиков неизменно выбирало Atlas
Источник: the-decoder.com
Atlas показывает наименьшую среднюю ошибку реконструкции среди всех сравниваемых специализированных моделей; чем ниже значение, тем лучше
Источник: the-decoder.com
Компания утверждает, что качество Atlas растёт вместе с объёмом вычислений на обучении, и ожидает сохранения этой тенденции при дальнейшем масштабировании. Модель будет использоваться в следующих версиях Marble и других продуктах World Labs. Сейчас Atlas доступна избранным партнёрам в рамках программы раннего доступа.
История World Labs
World Labs основала в 2024 году Фэй-Фэй Ли, создательница ImageNet и руководитель подразделения ИИ Google Cloud с 2017 по 2018 год. На старте компания привлекла Andreessen Horowitz, AMD, Intel и Nvidia.
Первая система, представленная в конце 2024 года, позволяла перемещаться в созданной сцене, но пользователи могли пройти лишь несколько виртуальных метров, после чего сталкивались с невидимыми границами. В ноябре 2025 года появился Marble.
В феврале 2026 года World Labs привлекла $1 млрд от Autodesk, Andreessen Horowitz, Nvidia и AMD. До этого Bloomberg сообщал о переговорах, в рамках которых компанию оценивали в $5 млрд.
Что считать моделью мира
Исследователи пока расходятся в том, какие системы следует относить к моделям мира. Международная команда под руководством Пекинского университета предложила единое определение в апреле 2026 года через OpenWorldLib.
Согласно этому подходу, чистые модели преобразования текста в видео не считаются моделями мира, поскольку у них нет циклов обратной связи с реальным миром. 3D-реконструкция и симуляторы вроде тех, что входят в Atlas, относятся к базовым компонентам такой системы: они создают среды, в которых можно проверять физические правила.
Источник: the-decoder.com
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram