Как ИИ-агенты начинают самостоятельно обучать роботов
Физический мир превращается в исполняемую среду, а большая модель — в инженера робота
Чтобы научить робота новому действию, обычно нужно собрать данные, обучить модель, проверить её на реальном железе, найти ошибки, собрать новые данные и снова запустить обучение. Сейчас появляется другой подход: вместо того чтобы каждый раз обучать новую модель под конкретную задачу, роботу дают ИИ-агента, который сам пишет программу действий, запускает её в физическом мире, видит результат, исправляет ошибки, сохраняет удачные решения как новые навыки — и затем может использовать собственный опыт для обучения специализированных моделей.
Один из самых интересных примеров такого подхода сейчас показывает Waddle Labs — стартап из Y Combinator 2026. Но интересен здесь не столько сам стартап, сколько изменение всей архитектуры обучения роботов.
От VLA к агенту: ещё один уровень над моделью
Последние несколько лет физический ИИ в основном развивался вокруг Vision-Language-Action моделей (VLA). Такая модель получает изображение с камеры и команду, после чего напрямую генерирует действия робота.
Большая модель здесь становится не моторикой робота, а его инженером. И это принципиально другой подход.
От обучения модели к программированию поведения
Идея использовать LLM для генерации программ управления роботами появилась не вчера. Ещё в работе Google Code as Policies, впервые опубликованной в 2022 году, исследователи показали, что модель можно использовать как генератор политик роботов. Человек задаёт команду естественным языком, а модель пишет исполняемую программу, которая использует восприятие и контроль в качестве API робота.
На каждую команду вроде «передвинь объект немного левее» — своя заранее обученная политика
LLM определяет объект через API восприятия, получает его координаты, рассчитывает новое положение и вызывает нужные контроллеры
Причём Code as Policies уже умел иерархически создавать новые функции из более простых и накапливать собственную библиотеку кода. Но современные агенты для программирования умеют больше. Они могут написать решение, запустить его, посмотреть на результат, найти ошибку, изменить код, запустить снова. И именно этот цикл разработки ПО сейчас переносится в физический мир.
Физический мир становится исполняемой средой
Допустим, робот должен взять деталь и положить её в слот. Агент получает камеры и набор доступных возможностей:
Найти объект
распознать деталь в кадре
Определить координаты
перевести пиксели в положение в пространстве
Построить траекторию
рассчитать путь движения
Подвести манипулятор
вывести руку в точку подхода
Закрыть gripper
выполнить захват
Проверить захват
убедиться, что деталь в руке
Вызвать специализированную VLA
отдать тонкое движение обученной политике
Вернуться в исходную позицию
подготовиться к следующей попытке
Дальше он сам собирает программу:
Если деталь выпала или оказалась не в том месте, агент получает новое состояние мира, определяет, что задача не выполнена, меняет решение и запускает следующую попытку. Получается физический аналог работы агента для программирования:
В свежей работе CaP-X исследователи сравнили single-turn генерацию кода для роботов с multi-turn режимом, где агент может видеть фидбек, анализировать результат и исправлять программу. Возможность итеративно смотреть на трейсы и состояние среды улучшала результат у большинства моделей. Причём восстанавливаться удавалось не только после программных ошибок, но и после физических — например, неудачного захвата.
Сначала модель формулирует гипотезу. Далее робот проверяет её в реальности. После чего среда возвращает результат, а агент обновляет решение. И в итоге физический мир становится частью вычислительного цикла.
Но LLM не должна управлять каждым контроллером
Отсюда не следует, что большую рассуждающую модель нужно подключить непосредственно к каждому суставу робота. Наоборот. Свежая работа Anthropic Claude plays robotics хорошо показывает, насколько сильно результат зависит не только от самой модели, но и от интерфейса между моделью и роботом. Исследователи сравнили несколько вариантов:
Прямое управление
модель управляет роботом напрямую
Генерация Python-контроллеров
модель пишет код управления
Обучение отдельной политики
классический путь через обучение
Управление через предобученные политики
готовый контроллер как инструмент
При низкоуровневых манипуляциях полный успех у передовых моделей оставался очень низким. Когда же модели давали VLA или другой предобученный контроллер как высокоуровневый инструмент, результаты заметно улучшались. Есть и более фундаментальная проблема — скорость.
Поэтому архитектура физического ИИ, вероятнее всего, будет многоуровневой.
Поэтому противопоставлять agentic robotics и VLA неправильно. Скорее VLA превращается из всей системы в один из инструментов агента.
Робот начинает накапливать навыки
Следующий важный шаг — память. Если агент каждую задачу решает заново, большого накопительного эффекта не возникает. Поэтому успешные решения превращаются в переиспользуемые навыки.
Допустим, робот учится правильно захватывать край ткани. Первая траектория не сработала. Агент меняет точку контакта. Пробует другой угол. Меняет высоту движения. Так после нескольких итераций появляется устойчивое решение. Его можно сохранить как функцию — и при следующей похожей задаче агент уже не восстанавливает всю механику с нуля. Он использует готовый навык.
Это уже не обычная память для LLM.
Сохраняется текст — описание того, как что-то делается
Сохраняется исполняемый способ действия — то, что можно вызвать и выполнить
Не просто память — накопление собственной библиотеки навыков
Этот механизм независимо исследуется и в CaP-X. Там агенты во время выполнения сами создавали вспомогательные функции. Исследователи собрали успешные трейсы, выделили повторяющиеся паттерны и сформировали из них библиотеку навыков. Навыки не были заранее написаны человеком. Они возникли из успешных действий самих агентов.
От навыков к собственной фабрике данных
Но самое интересное начинается дальше. ИИ-агента можно использовать не только для выполнения задач. Его можно использовать для самостоятельного производства тренировочных данных.
Waddle показал это на LEGO. Агенту дали задачу выполнять захват и перемещение при различных позициях и ориентациях объекта. Система самостоятельно провела примерно тысячу попыток за одну ночь, собрала траектории, а затем на этих данных автономно обучила политику с нуля.
Роботы начинают производить собственные данные
Одна из главных проблем физического ИИ — отсутствие данных. Для LLM есть интернет. Для визуальных моделей есть миллиарды изображений и видео. А данных о точных физических взаимодействиях намного меньше. Чтобы получить пример того, как конкретное устройство для захвата берёт конкретную деталь под конкретным углом, это действие кто-то должен выполнить. Поэтому датасеты для роботов приходится собирать через телеуправление, симуляцию и ручные демонстрации.
Агентная система позволяет автоматизировать часть этого процесса. Она может работать по кругу сама:
🔀 Изменить положение объектов — создать новую конфигурацию сцены
🧪 Запустить эксперимент — выполнить программу на реальном железе
👀 Проверить вывод — оценить, получилось или нет
♻️ Перезапустить сцену — вернуть мир в исходное состояние
✏️ Изменить программу — учесть то, что пошло не так
🔁 Провести новую попытку — и записать траекторию
➡️ Перейти к следующей конфигурации — и так далее, без человека
Ошибки могут оказаться ценнее успешных действий
Особенно интересны здесь трейсы с вмешательством.
наблюдение → правильное действие
Только то, как надо делать
наблюдение → программа → исполнение → ошибка → диагностика → исправление → новое действие → исход
Не только правильные траектории, но и физический дебаггинг
То есть будущую модель можно потенциально обучать не только тому, как правильно взять объект, но и тому, как понять, почему захват не получился и что делать дальше. Получается несколько уровней обучения одновременно:
🔧 Агент исправляется внутри одной задачи
написать → запустить → посмотреть → отладить → повторить
🧩 Успешные решения превращаются в переиспользуемые навыки
процедурная память
🗂️ Физические эксперименты превращаются в датасет
собственная фабрика данных
⚡ На нём обучаются быстрые специальные политики
дешёвое исполнение
🧠 Аккумулированный опыт учит следующее поколение самого физического размышляющего агента
пятый, пока потенциальный уровень
Возникает маховик опыта роботов
Тогда появляется довольно интересный цикл:
Способность LLM писать Python-код довольно быстро перестаёт быть конкурентным преимуществом и становится стандартной возможностью. Гораздо ценнее накопленный слой опыта роботов: какие стратегии работали, где они ломались, какие навыки обобщаются и на каком железе, и как восстановиться после ошибок.
Но код может оказаться вообще не главным
Есть ещё одна интересная работа — VIA. Она показывает альтернативный путь. Там агент вообще не обязательно генерирует code-as-policy. Он получает визуальный 3D-интерфейс, смотрит на состояние среды, вызывает небольшой набор понятных действий, наблюдает результат и исправляется.
Это хорошая контргипотеза. Возможно, фундаментальный переход заключается не именно в генерации Python-кода. Возможно, более общая формула выглядит так:
Сегодня удобным промежуточным представлением является код. Через несколько поколений моделей им может стать другой интерфейс. Поэтому важнее не сам Python, а появление замкнутого агентного цикла между рассуждающей моделью и физической средой.
К тому же стеку уже пришёл Google
Особенно показательно, что похожая архитектура одновременно появляется у крупнейших лабораторий. В июле 2026 года Google DeepMind представил Gemini Robotics 2. Там уже буквально разделены несколько типов интеллекта:
Gemini Robotics 2
VLA, которая отвечает за физическое выполнение
Gemini Robotics ER 2
воплощённая рассуждающая модель — высокоуровневый агент
Gemini Robotics On-Device 2
более эффективная VLA для локального запуска
Рассуждающая модель понимает инструкцию, наблюдает среду, планирует несколько шагов, вызывает VLA, отслеживает прогресс и исправляется при ошибке. А по данным Google, локальную версию можно адаптировать к совершенно новому роботу за несколько часов, обычно используя менее 200 примеров.
От одного робота к команде роботов
Следующий шаг — мультиагентная система. Waddle описывает суперагента, который может создавать отдельных агентов для разных роботов и координировать их параллельное выполнение.
И это логичное продолжение всей архитектуры. Если ИИ-агент может управлять несколькими агентами для разработки ПО, то следующий объект оркестрации — несколько физических машин. Тогда мы постепенно переходим от ИИ, который управляет отдельным роботом, к ИИ, который управляет роботизированной производственной системой.
Что здесь действительно новое
Если собрать вместе Code as Policies, CaP-X, ASPIRE, VIA, Anthropic, Waddle и последние модели Google, становится видно достаточно отчётливое направление.
Речь уже не просто о том, что LLM научилась отдавать команды роботу. И не о том, что code-as-policy обязательно победит VLA. Происходит более фундаментальный переход.
Именно такую архитектуру лучше всего описывает совокупность последних работ. Физический мир становится исполняемой средой, успешные программы становятся процедурной памятью, а ошибки используются как данные для обучения. Большая рассуждающая модель здесь становится инженером, который связывает все эти уровни вместе.
Возможно, именно так роботы действительно начнут учиться
На мой взгляд, главный вопрос физического ИИ постепенно меняется.
Как обучить одну достаточно большую модель делать как можно больше физических действий
Как построить систему, которая сама научится новому действию, которого пока нет в её обучающем датасете
Поэтому следующий этап робототехники, вероятно, будет эпохой агентного физического интеллекта, где рассуждающие агенты думают и управляют процессом, специальные политики быстро действуют, контроллеры управляют физикой, роботы генерируют опыт, а весь накопленный опыт снова возвращается в систему.
И тогда робот становится машиной, которая умеет самостоятельно учиться работать в физическом мире.
Подписывайтесь на Датаиста
Разбираю реальные кейсы внедрения ИИ, делюсь практикой и мыслями о том, как меняется работа и бизнес.
Кейсы, мысли и ИИ-технологии
— в Telegram.