За пределами VLA: как WAM меняют управление роботами
NVIDIA описала переход от моделей зрительно-языково-управляющего действия (VLA) к моделям действий мира (WAM) — моделям действий, построенным на видеомоделях мира. VLA хорошо понимают сцены и инструкции, но не учатся предсказывать, как изменится окружающая обстановка: что произойдёт с кружкой при закрытии захвата или куда упадёт отпущенный предмет. WAM моделируют динамику мира ещё до постобучения, поэтому требуют меньше данных, лучше работают за пределами обучающей выборки и быстрее адаптируются к новым роботам. В качестве основы NVIDIA предлагает Cosmos 3 — модель с 4B, 16B и 64B параметрами.
От VLA к WAM
Одна из центральных задач робототехники — создавать политики управления, которые обобщают опыт за пределами показанных им примеров. Политика может успешно работать в сцене из обучения, но провалиться, если изменятся форма предметов, их положение или освещение. Для работы в новых условиях робот должен понимать физику задачи, а не просто повторять демонстрации. Многое здесь зависит от базовой модели, на которой построена политика.
Обычно языково-управляемую политику для робота создают так: к заранее обученной зрительно-языковой модели (VLM) добавляют модуль действий. Так получается модель зрительно-языково-управляющего действия, или VLA. Этот подход заметно продвинул универсальное управление роботами.
Но VLM оптимизирована для описания изображений текстом, а не для моделирования дальнейшего развития сцены. Она не учится тому, что произойдёт с кружкой при закрытии захвата, как сложится полотенце или где окажется предмет после отпускания. Поэтому VLA хорошо обобщают смысл сцены, но хуже справляются с физическими изменениями в незнакомых ситуациях и средах: их базовые модели описывают язык и восприятие, а не динамику мира.
Исследователи предлагают заменить языковую основу на видеомодель мира и получить модель действий мира, или WAM. Такая базовая модель уже описывает развитие окружающей обстановки, поэтому на этапе постобучения не нужно осваивать динамику с нуля — достаточно специализировать модель, в которой уже есть физическое представление мира. Исследователь NVIDIA Джим Фан рассказал об этом переходе в докладе «Финал робототехники». Позже идею кратко сформулировали так: «VLA мертвы, да здравствуют модели действий мира».
В исследовательской работе «Модели действий мира — это политики без дообучения» показано, что совместное предсказание видео и действий даёт политике свойства, которые VLA сложно получить тем же способом.
Для команд, создающих роботизированные политики, это означает меньше данных для достижения заданной способности, более устойчивое поведение за пределами обучающего распределения и более короткий путь к переносу на новую конструкцию робота. Эти свойства заложены в базовой модели ещё на этапе предварительного обучения и поэтому проявляются в каждой политике, созданной на её основе.
Что такое Cosmos 3
Cosmos 3 — универсальная базовая модель мира, построенная на архитектуре смеси трансформеров (MoT). Мультимодальные данные проходят через авторегрессионный трансформер, который выполняет рассуждение и создаёт дискретные токены, например текст. Затем эта информация направляет диффузионный трансформер, работающий с непрерывными модальностями: изображениями, видео, аудио и действиями.
Текст модель создаёт последовательным предсказанием следующего токена. Остальные данные, включая действия, синтезируются итеративным удалением шума. Одна модель работает с несколькими модальностями, используя для каждой подходящий способ генерации.
Cosmos 3 выпускается в трёх вариантах: 4B NVIDIA Cosmos Edge, 16B NVIDIA Cosmos Nano и 64B NVIDIA Cosmos 3 Super.
Базой для постобучения Cosmos 3 делает широкий набор данных о физическом мире. В него входят примерно 767 млн изображений, 348 млн видео с динамикой реального мира и 8 млн образцов действий. Они охватывают управление роботами, автономное вождение, движение камеры и движения от первого лица.
Политики для роботов
Cosmos 3 служит отправной точкой для специализации. Cosmos3-Nano-Policy-DROID — политика с 16 млрд параметров, полученная постобучением Cosmos 3 Nano для платформы DROID. В её основе — роботизированная рука Franka Panda с захватом Robotiq.
Версия на 4 млрд параметров, Cosmos3-Edge-Policy-DROID, обучена тем же способом и предназначена для развёртывания на устройстве. Получив языковую инструкцию и данные с нескольких камер, модель генерирует траектории действий робота.
Далее авторы выделяют три свойства, которые следуют из универсальной основы Cosmos 3.
WAM включает полноценную генеративную модель мира, а не только модуль действий. Поэтому такая система больше компактных VLA, но Cosmos 3 предлагает разные варианты для различных уровней развёртывания и не заставляет выбирать один фиксированный компромисс.
WAM отражают переход от обучения действиям к обучению тому, как развивается окружающий мир. Cosmos 3 делает такой подход практичным.
Самый быстрый способ проверить, превосходит ли WAM вашу текущую VLA, — провести постобучение модели на собственных данных и сравнить результаты.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram