i
ДАТАИСТ
Новости · 2026-08-31

Предобучены воображать, дообучены действовать: расцвет моделей мира и действий

@neuronium_ai @neuronium_ai

Модели мира и действий, или WAM, быстро превращаются в новый крупный подход к созданию базовых моделей для роботов. В октябре 2025 года это направление считалось небольшой частью исследований VLA, но за последние месяцы появились публичные разработки NVIDIA DreamZero и Cosmos Policy, LingBot-VA от Ant Group, DVA от Rhoda ИИ, Cortex 2.0 от Sereact и mimic-video от Mimic Robotics. WAM используют предварительно обученные видео- или мировые модели, чтобы одновременно предсказывать будущее состояние сцены и действия робота. Теперь исследователи выясняют, станет ли это устойчивой альтернативой VLA на базе VLM или популярность WAM окажется коротким всплеском.

Обложка: Предобучены воображать, дообучены действовать: расцвет моделей мира и действий

WAM набирают популярность в робототехнике

Два базовых компонента

Зрительно-моторная политика получает текущие наблюдения вместе с целью или инструкцией и выдает действия робота. Модель мира, напротив, по текущему состоянию и действию либо его абстрактному описанию предсказывает будущее визуальное или скрытое состояние.

WAM находится на пересечении этих подходов: она использует предварительно обученную видео- или мировую модель как исходное представление и одновременно прогнозирует будущие состояния и действия робота.

В прошлом году ежедневный дайджест Scholar Inbox почти полностью состоял из новых работ о VLA. В последние месяцы ситуация изменилась: почти каждый день там появляется термин WAM — сокращение от «модели мира и действий». В октябре 2025 года автор писал в материале «Состояние VLA», что WAM остаются небольшим направлением внутри исследований VLA и заметно уступают по популярности VLA, созданным на базе VLM. Теперь это быстро меняется.

Причина может быть прозаичной: WAM стали новым направлением, которым хотят заниматься многие команды, а для VLA уже трудно придумывать новые названия — варианты вроде X-VLA и Ego-VLA заняты. Но вероятнее, дело в том, что VLA на базе VLM столкнулись с ограничениями.

Современные VLA получили преимущества от масштабного предварительного обучения на изображениях и текстах, однако по-прежнему испытывают трудности с переходом от языка к действию. Связь между языком, пикселями и поведением приходится изучать на робототехнических данных. WAM предлагают другую точку старта: предварительно обученные видео- или мировые модели уже описывают, как сцена меняется под воздействием языка. Если это представление удается перенести на генерацию поведения, разрыв между видео и действием может оказаться меньше, чем задача прямого обучения связи «язык — действие».

Идеи WAM появились не сейчас. Ранние модели, например UniPi [10], предлагали похожий подход еще в 2023 году. Поэтому остаются два вопроса: почему этот принцип только спустя несколько лет вошел в основное направление развития базовых моделей для роботов и на каком этапе направление находится сегодня.

Центральный вопрос — стал ли WAM устойчивым сдвигом в исследованиях и промышленности или это всего лишь короткий цикл ажиотажа. Если такой рецепт настолько полезен, почему после первых работ вроде UniPi прошло несколько лет, прежде чем WAM стали популярными?

По мнению автора, WAM станут вторым крупным рецептом для базовых моделей роботов наряду с VLA на базе VLM. Пока неясно, какая формулировка WAM окажется успешнее и какие элементы архитектуры и конвейера данных действительно важны. Вероятно, в итоге победит гибрид, объединяющий VLA и WAM.

Далее автор предлагает карту современного пространства WAM: классифицирует подходы, объясняет, что изменилось со времен ранних моделей, и сопоставляет нынешние результаты с VLA. Более широкий обзор представлен в недавней работе NTU «Модель мира для обучения роботов: всесторонний обзор» [57], где модели мира для обучения роботов рассматриваются в задачах симуляции, оценки, навигации и автономного вождения.

Два подхода к базовым моделям роботов

Сейчас в исследованиях и промышленности конкурируют два основных способа представить знания в базовой модели робота.

Первый — традиционный рецепт VLA, сформированный Pi-0 [2] и позднее доработанный в Pi-0.5 [4]. В нем обучение политике начинается с основы VLM. Такой подход используется, в частности, в открытых разработках NVIDIA GR00T [5], Xiaomi Robotics [27], Being-H0.5 [28] и других команд.

Модели мира в робототехнике. Модели мира, обусловленные действиями (DreamDojo, Genie, JEPA-WM), предсказывают будущие состояния на основе выученной абстракции действий. Видеомодели мира (Cosmos-3, WAN, Veo, LTX-Video) предсказывают будущее видео с учетом языка и опорного кадра. Модели World-Action (WAM), такие как DreamZero, LingBot-VA, UniPi и mimic-Video, находятся на пересечении этих подходов:

Источник: developer.nvidia.com

Второй подход появился позднее: использовать предварительно обученные видео-модели как альтернативный путь к универсальным задачам манипуляции. Среди публичных примеров — DreamZero [8] и Cosmos Policy [13] от NVIDIA, LingBot-VA [9] от Ant Group, DVA [40] от Rhoda ИИ, Cortex 2.0 [45] от Sereact и mimic-video [14] от Mimic Robotics.

Новые идеи в этом направлении также развивают университетские лаборатории и открытые исследовательские группы. Среди таких работ — «Политика с предсказанием видео» [24], «Единая модель видео и действий» [39] и Fast-WAM [23]. Ниже рассматриваются они и другие модели.

Выбор основы влияет на весь процесс обучения и оценки: на рецепт обучения, состав данных и оптимизацию инференса. Поскольку запуск таких моделей в больших масштабах обходится дорого, большинству команд, вероятно, придется сначала выбрать одно направление — VLA или WAM, — вместо того чтобы параллельно полноценно развивать оба. Какая стратегия окажется рабочей и сблизятся ли эти подходы, пока неизвестно.

Прежде чем переходить к современным моделям, нужно понять, почему WAM рассматривают как альтернативу VLA на базе VLM, а также какое место они занимают среди моделей мира в робототехнике.

Ограничения VLA на базе VLM

Первые VLA создавались с расчетом использовать знания VLM, полученные из наборов данных интернет-масштаба. VLM обучаются на огромных массивах изображений и текстов и показывают заметные результаты в задачах компьютерного зрения без дополнительного обучения. Рецепт VLA адаптирует эти предварительно обученные представления для генерации действий.

Между предварительным обучением VLM и физической манипуляцией существует существенный разрыв. В нескольких работах отмечалось, что способности исходных VLM ухудшаются, либо авторы специально проектировали систему так, чтобы этого избежать — особенно когда задача обучения действиям сильно отличается от первоначальной цели VLM.

VLM2VLA прямо описывает эту проблему как катастрофическое забывание при переходе от VLM к VLA [55]. Работа «Изоляция знаний» связывает ее с архитектурой: градиенты модуля действий на основе сопоставления потоков отделяются от основы VLM, чтобы сохранить предварительно полученные знания о языке и изображениях. По данным авторов, это улучшает сходимость обучения, результаты на задачах и следование языковым инструкциям [20].

Недавние решения, включая совместное обучение VLM и дискретные токенизаторы действий, помогли смягчить проблему. Но основная трудность сохраняется: нужно связать язык с физическим действием, имея ограниченный объем робототехнических данных. Эти решения рассматриваются далее в разделе о современных базовых VLA.

Отсюда возникает вопрос: что изменилось бы, если начать с основы, которая уже умеет представлять, как язык связан с визуальными изменениями в мире?

Видео-модели как основа для WAM

Идея проста: вместо VLM, с которой начинается обучение имитации, можно использовать предварительно обученную видео-модель.

Современные видео-модели обучаются на больших видеокорпусах и осваивают пространственно-временные представления того, как меняются визуальные сцены. Многие из них работают по текстовому условию: генерируют видео по подробному описанию, иногда используя исходный кадр, а иногда — только текст.

На таких видео часто показано намеренное поведение: руки тянутся к объектам, инструменты перемещаются, предметы взаимодействуют друг с другом, а сцена меняется из-за действий человека или робота. Поэтому видео-основы выглядят подходящим исходным представлением для универсальной манипуляции. Еще до знакомства с робототехническими действиями модель уже кодирует связи между языком, визуальными изменениями и правдоподобным взаимодействием с объектами.

Ниже автор приводит короткую иллюстрацию с Veo 3.1.

Следующие три положения автор предлагает считать гипотезами, а не установленными выводами. Они повторяются в научных работах, обсуждениях с коллегами и собственном анализе направления; их поддерживают качественные наблюдения, результаты в симуляции и несколько ранних сигналов из реального мира. Однако сопоставимых чистых сравнений пока нет.

Насколько много современные видео-модели уже понимают до добавления специализированного модуля действий для робототехники? Чтобы проверить это, авторы провели простой эксперимент с Veo 3.1 от Google — одной из лучших моделей генерации видео на данный момент.

Они взяли один исходный кадр из прогона RoboArena с задачей про тостер в среде DROID. Затем попросили Veo сначала надавить на рычаг тостера — это соответствовало исходной задаче и демонстрации DROID, — а потом поднять апельсин слева от тостера. Вторая часть была составным продолжением, которого не было в демонстрации.

Вероятность того, что именно этот прогон присутствовал в обучающих данных Veo, очень мала, однако проверить состав набора напрямую нельзя. Поэтому эксперимент следует воспринимать как качественную проверку исходного представления, а не как контролируемое исследование принадлежности данных к обучающей выборке. Это была одна попытка без оптимизации запроса.

Модель получила инструкцию сгенерировать видео, в котором роботизированная рука из исходного кадра сначала нажимает на рычаг тостера, а после завершения этой задачи берет апельсин слева от тостера и останавливается.

Контекстный кадр из задачи с тостером в RoboArena в конфигурации DROID

Источник: developer.nvidia.com

Что показала Veo 3.1

Veo 3.1 без дополнительного обучения на робототехнических данных сгенерировала прогон с нулевого шага. Для модели, которую специально не обучали быть политикой робота, результат оказался заметно правдоподобным: движения были плавными, фон сохранял стабильность, а рука двигалась к обоим целевым объектам по разумной траектории. Модель также соблюла порядок действий: сначала рычаг, затем апельсин.

Эталонная траектория: робот толкает рычаг тостера

Источник: developer.nvidia.com

Ограничения при этом хорошо видны. Рычаг тостера не был полностью нажат, а в некоторых местах модель, судя по движению, пыталась потянуть его вверх. Еще заметнее другое: захват с двумя пальцами из исходной установки DROID превратился в четырехпалую кисть. Почти сразу после первого кадра роботизированная рука с фиксированным основанием была переосмыслена как другой робот с меньшим числом степеней свободы.

Прогон Veo 3.1 для опорной задачи (нажатие на рычаг тостера)

Источник: developer.nvidia.com

Такие артефакты показывают, что модель опирается на общие визуальные представления, а не точно моделирует конкретное оборудование.

Тем не менее результат объясняет интерес к видео-основам в робототехнике. Модель уже имеет полезное представление о том, как может выглядеть взаимодействие робота с объектами, хотя для надежного управления этого пока недостаточно. Дообучение WAM должно превратить такое воображение с нулевого шага в устойчивое управление.

Анимированный прогон полной составной последовательности расширения: нажатие на рычаг с последующим поднятием апельсина

Источник: developer.nvidia.com

Как устроены современные WAM

После этого можно перейти к текущим исследованиям WAM. В отличие от VLA на базе VLM, где рецепт обучения в основном сошелся вокруг совместного обучения VLM и потокового трансформера для генерации действий, WAM пока развиваются сразу в нескольких направлениях.

Именно поэтому в этой области еще нет единого набора решений: исследователи не знают, какая комбинация архитектурных выборов окажется лучшей и будут ли успешные системы объединять элементы разных подходов.

Чтобы сделать пространство вариантов понятнее, WAM можно рассматривать по трем осям. Эти оси не полностью независимы.

Пространство проектирования WAM с первого взгляда. Слева: три парадигмы различаются тем, что предсказывает модель. WAM с инверсной динамикой сначала генерирует будущее видео, а затем выводит из него действия. WAM с совместным предсказанием выдает видео и действия одновременно. WAM только с представлением использует видеобэкбон исключительно как представление и пропускает генерацию видео во время в

Источник: developer.nvidia.com

Некоторые WAM плохо вписываются в одну категорию, поэтому это не строгая классификация, а практическая карта для чтения современных работ без путаницы в названиях. Для каждой оси автор сначала приводит более раннюю работу, а затем современную масштабированную версию примерно того же рецепта.

Первая ось — формулировка политики: что именно предсказывает модель и как предсказанное видео используется для получения действий. В современных WAM заметны три направления, которые различаются на границе инференса: обратная динамика, совместное предсказание и работа только с представлением.

WAM с инверсной динамикой (абстрактная схема). Видеомодель сначала создает будущие кадры или латентные представления на основе языковой инструкции и текущего наблюдения; затем головка инверсной динамики преобразует предсказанный переход в последовательность действий. Конкретные системы различаются тем, используют ли они полные будущие RGB-кадры (LingBot-VA, DVA), латентные признаки видео (VPP, mim

Источник: developer.nvidia.com

Обратная динамика

Схема с обратной динамикой — самый понятный вариант WAM: сначала модель представляет будущее, а затем по этому видео предсказывает наиболее вероятное действие.

Такой подход переносит сложную задачу связывания языка с действием на этап генерации видео: команда должна быть преобразована в правдоподобное визуальное изменение. Основная гипотеза состоит в том, что видео-предварительное обучение уже сформировало полезную часть связи «язык — визуальное изменение». Поэтому модулю действий не нужно заново учиться всему на робототехнических демонстрациях — он может сосредоточиться на задаче обратной динамики.

Обзор UniPi. Генератор видео, обусловленный текстом, создает последовательность будущих изображений на основе текущего кадра и языковой инструкции; затем отдельный модуль инверсной динамики извлекает действия из последовательных кадров

Источник: developer.nvidia.com

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram