i
ДАТАИСТ
Новости · 2026-08-29

Как обучить навигационную политику для разных роботов с помощью ИИ-агентов

Навигация превращает восприятие и движение робота в самостоятельное выполнение целей: система должна постоянно определять своё положение, понимать изменения вокруг, выбирать маршрут и обходить препятствия. Перенос этой способности на нового робота или в новую сцену обычно требует отдельных данных, симуляции, интерфейсов, обучения, диагностики и оценки. В материале показан управляемый ИИ-агентами рабочий процесс COMPASS: разработчик задаёт робота, сцену и цель, а агент для программирования проверяет зависимости, готовит ресурсы, запускает тесты и обучение, диагностирует ошибки и сравнивает контрольные точки. Человек при этом подтверждает ключевые этапы.

Обложка: Как обучить навигационную политику для разных роботов с помощью ИИ-агентов

Как обучать навигации роботов с помощью ИИ-агентов

Навигация превращает восприятие и движение робота в самостоятельное выполнение целей: система должна постоянно определять своё положение, понимать изменения вокруг, выбирать маршрут и обходить препятствия. Перенос этой способности на нового робота или в новую сцену обычно требует отдельных данных, симуляции, интерфейсов, обучения, диагностики и оценки. В материале показан управляемый ИИ-агентами рабочий процесс COMPASS: разработчик задаёт робота, сцену и цель, а агент для программирования проверяет зависимости, готовит ресурсы, запускает тесты и обучение, диагностирует ошибки и сравнивает контрольные точки. Человек при этом подтверждает ключевые этапы.

Что делает навигация

Навигация позволяет роботу использовать восприятие и движение для достижения конкретной цели. В отличие от передвижения, которое отвечает за устойчивое движение, навигация должна постоянно решать несколько задач:

определять положение робота;
интерпретировать меняющуюся обстановку;
выбирать маршрут;
обходить препятствия;
безопасно достигать цели.

Перенос навигации на другого робота или в новую сцену может потребовать новых данных, ресурсов для симуляции, интерфейсов робота, обучения, диагностики и оценки. Повторять эту работу для каждой пары «робот — сцена» дорого и сложно воспроизводить.

Рабочий процесс с ИИ-агентом снижает объём ручных операций. Разработчик описывает робота, источник сцены и навигационную цель. Агент для программирования использует навыки, сохранённые в репозитории, чтобы:

проверить зависимости;
подготовить ресурсы;
запустить дымовые тесты;
начать обучение;
диагностировать сбои;
сравнить контрольные точки.

Человек подтверждает принятие сцены, запуск теста в одной среде и продвижение контрольной точки на следующий этап.

На примере робота Spot материал показывает рабочий процесс COMPASS с ИИ-агентом для встроенной сцены и сцены SAGE-10K. Также рассматривается, как NVIDIA Omniverse NuRec работает с захваченными окружениями. Процесс проходит через дымовое тестирование, обучение остаточной политики, оценку контрольных точек и подключение к системе исполнения, включая опциональное использование одометрии.

Что такое COMPASS

COMPASS — это единая программная платформа для масштабируемой мобильности разных роботов. Название расшифровывается как «Мобильная политика для разных воплощений через остаточное RL и синтез навыков». Платформа использует экспертные демонстрации, собранные для одного типа робота, и переносит навигационное поведение предварительно обученной политики NVIDIA X-Mobility.

Для выбранного робота и окружения COMPASS обучает остаточную специализированную политику. Это политика обучения с подкреплением, которая корректирует базовое действие под конкретную комбинацию робота и сцены, вместо того чтобы заново обучать навигацию с нуля. Позднее данные от нескольких специализированных политик можно объединить в общую политику для разных роботов.

COMPASS адаптирует базовую политику X-Mobility в специализированные политики для отдельных воплощений и дистиллирует их в политику для разных воплощений

Источник: developer.nvidia.com

Рабочий процесс с ИИ-агентом обучает и оценивает именно эту архитектуру COMPASS. Разработка упакована в виде навыков репозитория. В материале для разработки используется Codex. После обучения политика и контроллер робота выполняют навигацию самостоятельно, без агента для программирования.

Робот и окружения

В качестве эталонного робота используется четвероногий Boston Dynamics Spot.

Основной воспроизводимый путь — встроенный склад COMPASS. Сцена SAGE-10K позволяет перейти к сгенерированному окружению, а NVIDIA Omniverse NuRec даёт дополнительный вариант с реконструированной сценой.

Если робот не предоставляет совместимую одометрию и преобразования координат, для развёртывания можно использовать NVIDIA cuVSLAM — библиотеку визуальной одометрии и одновременной локализации и построения карты, ускоренную с помощью CUDA.

Для другого окружения рекомендуется использовать зафиксированный в репозитории программный стек COMPASS и соответствующее аппаратное обеспечение.

Политика NuRec Real2Sim (справа) перемещается вокруг стола к цели; для сравнения показана синтетическая политика (слева)

Источник: developer.nvidia.com

Подготовка репозитория

Сначала нужно подготовить репозиторий и заранее описать для агента рабочий контракт. До работы со сценой потребуется:

скачать ресурсы с ограниченным доступом;
сделать навык COMPASS доступным для Codex;
проверить программный стек;
остановиться на этапе подтверждения одной среды.

Блоки `$compass` — это копируемые запросы для диалога с Codex, запущенного из корня репозитория COMPASS, а не команды оболочки. В Claude Code тот же рабочий процесс вызывается через `/compass`.

В Codex сначала открывают навыки репозитория через `.agents/skills`, а затем выбирают COMPASS командой `/skills` или упоминанием `$compass` в запросе. Codex поддерживает символические ссылки на каталоги навыков, поэтому текущий навык можно оставить в поддерживаемом месте. В Claude Code используется тот же вызов `/compass`.

ИИ-агент может клонировать репозиторий, собрать проект, скачать несекретные ресурсы и проверить программный стек. Условия доступа к закрытым ресурсам принимает разработчик, и он же вводит токен Hugging Face вне диалога. Агент не должен запрашивать, показывать или сохранять этот токен в журналах.

Нужно клонировать репозиторий COMPASS и пройти краткий запуск из руководства COMPASS в контейнере, зафиксированном в репозитории. До первого запуска следует:

принять доступ к закрытым репозиториям Hugging Face `nvidia/COMPASS` и `nvidia/X-Mobility`;
создать токен Hugging Face только для чтения;
проверить, что токен позволяет читать доступные аккаунту публичные репозитории с ограниченным доступом;
оставить токен доступным только в текущей оболочке.

Токен нельзя вставлять в запрос агента или добавлять в систему контроля версий.

Ресурсы симуляции скачиваются в `./assets/usd/`, а предварительно обученная контрольная точка X-Mobility — в `./assets/x_mobility.ckpt`. Ответ 401 или 403 обычно указывает на неполный доступ к репозиторию или неподходящий уровень разрешений токена. Сначала нужно исправить доступ, а уже потом разбираться с Isaac Lab.

Каждая фаза должна завершаться проверяемыми свидетельствами перед переходом к следующей. Критерии подтверждения зависят от проекта, но на каждом этапе нужно ответить на одни и те же вопросы:

все ли необходимые входные данные на месте;
появились ли ожидаемые результаты;
остались ли нерешённые ошибки;
достаточно ли свидетельств для продолжения.

После запуска контейнера разработчик открывает ИИ-агента в корне репозитория и описывает робота, сцену, ожидаемый результат навигации и этапы подтверждения. Для базового рабочего процесса в запрос агента вставляется соответствующий запрос COMPASS. Навык проверяет запрос по репозиторию и запускает нужные проверки. Если запуск завершается ошибкой, `$compass-doctor` выполняет проверку состояния только для чтения и сообщает вероятные причины, не меняя окружение без разрешения.

Выбор сцены

COMPASS поддерживает три источника сцен:

встроенный склад COMPASS;
сгенерированную сцену SAGE-10K;
захваченное окружение, отрендеренное через Omniverse NuRec.

Для самого быстрого воспроизводимого запуска рекомендуется зарегистрированный склад `combined_multi_rack`. Робот, сцена и карта проходимости уже внесены в систему, поэтому такой вариант подходит для проверки установки перед добавлением новой сцены.

Квадрупед Spot перемещается по зарегистрированному в COMPASS складу combined_multi_rack

Источник: developer.nvidia.com

SAGE-10K содержит 10 000 сгенерированных сцен помещений 50 типов. Это набор сцен, а не политика и не симулятор. Каждая сцена включает геометрию, материалы, метаданные планировки и предварительный просмотр.

Гостиные и склады в SAGE-10K подготавливаются одинаково, поэтому скачивать весь набор не нужно: достаточно выбрать подходящую сцену.

10 000сгенерированных сцен
50типов помещений

Для SAGE-10K предусмотрены два этапа подтверждения человеком. Сначала в NVIDIA Isaac Sim нужно проверить преобразованный файл USD: геометрию, материалы, масштаб и сетки столкновений. После регистрации сцены и создания карты проходимости разработчик подтверждает предварительный просмотр в одной среде перед запуском полного обучения.

Карта проходимости показывает свободные и заблокированные зоны, в которых можно размещать начальные позиции робота и навигационные цели.

Квадрупед Spot в преобразованной сцене помещения SAGE-10K, подготовленной для валидации COMPASS

Источник: developer.nvidia.com

В Omniverse NuRec обращаются, если COMPASS нужно дообучить и оценить на реконструкции будущего рабочего окружения. NuRec преобразует стереоскопические RGB-съёмки в реконструкцию, готовую для Isaac Sim, с согласованной визуальной геометрией, сетками столкновений и возможностью дополнительно изменять сцену.

Документированный путь COMPASS для NuRec включает регистрацию отрендеренной сцены, проверку переданной карты проходимости и соглашения об исходной точке, проверку зазоров для робота и дымовой тест в одной среде перед обучением.

NuRec в этом рабочем процессе остаётся дополнительным вариантом. Практическое обучение продолжается на SAGE-10K, чтобы пройти одну сцену от подготовки до оценки. Для захваченного окружения следует использовать рабочий процесс COMPASS NuRec и руководство NVIDIA Isaac Sim NuRec, включая пример гостиной. В них описаны подготовка сцены, обучение, оценка, экспорт и развёртывание через ROS 2.

Codex отбирает подходящие сцены SAGE-10K и останавливается для утверждения разработчиком

Источник: developer.nvidia.com

После выбора сцены её нужно подключить к COMPASS и запустить предварительный просмотр в одной среде, прежде чем масштабировать обучение. Для SAGE-10K сначала необходимо завершить визуальную проверку и подтверждение регистрации сцены.

Во время предварительного просмотра проверяют, что:

Isaac Sim запускается;
сцена загружается;
Spot появляется в допустимой позиции;
камера выдаёт наблюдения;
робот реагирует на команды политики;
робот не врезается, не падает и не создаёт нерешённых ошибок симуляции.

ИИ-агент должен собрать краткое резюме журналов и визуальных свидетельств, указать блокирующие проблемы и остановиться до решения человека. К остаточному обучению переходят только после подтверждения, что сцена, робот, наблюдения и интерфейс действий работают вместе ожидаемым образом.

Остаточное обучение

COMPASS адаптирует предварительно обученную политику X-Mobility к выбранному роботу и сцене. После одобрения дымового теста ИИ-агент может запустить стандартный рабочий процесс остаточного обучения с подкреплением.

В базовом примере используются Spot и встроенный склад. При работе со сгенерированной сценой ключ окружения нужно заменить на зарегистрированную сцену SAGE-10K.

Остаточное обучение может длиться долго. Агент должен запускать его в постоянной сессии или через управляемый планировщик, сохранять журналы и контрольные точки в настроенный каталог результатов и сообщать о ходе работы, не удерживая открытой интерактивную сессию.

До начала обучения нужно зафиксировать:

команду запуска;
ревизию репозитория;
ключ сцены;
конфигурацию;
интервал сохранения контрольных точек;
условия остановки.

Если запуск прервался, следует проверить целостность последней контрольной точки и уточнить поддерживаемые варианты продолжения.

Параметр `--num_envs` выбирают с учётом доступной памяти GPU. Для дымового теста используется только одна среда. Во время обучения нужно отслеживать:

компоненты награды;
продвижение к цели;
столкновения и падения;
завершение эпизодов;
скорость обработки;
использование памяти GPU.

Контрольные точки следует сохранять регулярно и оценивать в одинаковых условиях. Нельзя заранее считать, что лучшей окажется последняя итерация. COMPASS также поддерживает распределённое обучение на нескольких GPU для более крупных запусков. Продолжительность обучения зависит от оборудования, сложности сцены, числа сред и условий остановки.

При сбоях сначала используется диагностический рабочий процесс COMPASS, а не произвольное изменение окружения или конфигурации:

ошибки аутентификации направляются на проверку доступа к Hugging Face;
ошибки загрузки сцены и столкновений — на этап подготовки сцены;
ошибки камеры или интерфейса действий — на этап дымового теста;
ошибки памяти — на настройку числа сред или нескольких GPU.

Нужно сохранять конфигурацию обучения, команду запуска, ревизию репозитория, регистрацию сцены, карту проходимости, свидетельства дымового теста, журналы, контрольные точки и манифест артефактов.

Перед изменением зависимостей, ресурсов сцены, наград или параметров обучения требуется подтверждение разработчика.

Оценка контрольной точки

Следующий этап определяет, готова ли остаточная контрольная точка к продвижению. Для этого предварительно обученную базовую политику и кандидатов с остаточным обучением сравнивают в одинаковых условиях.

Стандартная оценка COMPASS включает:

долю достигнутых целей;
долю падений;
время прохождения.

Дополнительные сведения — например, продвижение к цели, поведение при контактах, задержки по времени и стабильность команд — нужно помечать как производный анализ или результаты собственной инструментальной проверки.

Контрольную точку продвигают только после того, как сопоставимые результаты проходят проектные требования по навигации и безопасности, а человек подтверждает упаковку модели.

На этапе вывода политика COMPASS использует входные данные RGB, одометрию и точку цели, а также опциональные данные карты и маршрута, чтобы выдавать команды линейной и угловой скорости для контроллера робота

Источник: developer.nvidia.com

Подключение к роботу

После завершения разработки обученную политику подключают к системе исполнения робота. Здесь рассматриваются входы и выходы эталонной политики, использование cuVSLAM для одометрии и рабочий процесс для ещё не зарегистрированного робота.

ИИ-агент координирует разработку и проверку, но не управляет роботом во время работы.

Этап подготовки COMPASS скачивает контрольную точку предварительно обученной X-Mobility, которая используется в дымовых тестах и остаточном обучении. В результате обучения создаётся остаточная контрольная точка для выбранного робота и сцены. Экспорт и развёртывание упаковывают обученную политику для инференса. Базовая и остаточная политики не превращаются в два компонента ROS 2, которые разработчик должен соединять вручную.

В эталонной интеграции ROS 2 компонент `compass_inference` преобразует:

изображения с передней камеры;
навигационную цель или маршрут;
скорость робота, рассчитанную по одометрии,

во входы экспортированной политики.

Компонент публикует команды линейной скорости вперёд и угловой скорости в `/cmd_vel`. Рекуррентное состояние и предыдущее действие остаются внутренними данными реализации инференса и не передаются через внешнюю интеграцию ROS.

Для целевого развёртывания нужно проверить системы координат, частоту обновления, нормализацию, ограничения команд, поведение при остановке и контроллер физического робота.

cuVSLAM применяют, когда роботу требуется оценка состояния по камере в окружении без GPS или с нестабильным GPS, а сам робот не предоставляет совместимую и проверенную одометрию с нужными преобразованиями. Одометрия cuVSLAM может использоваться навигатором COMPASS, но карта cuVSLAM не является входом навигационной политики.

cuVSLAM не входит в обучение политики COMPASS и не требует навыка агента. Его запускают как отдельный компонент ROS 2 с согласованными версиями, подключают или перенаправляют его одометрию в `/chassis/odom`, добавляют требуемое преобразование `odom` в `base_link` и проверяют калибровку, временные метки, имена топиков и соглашения о системах координат.

Во время разработки могут помочь дополнительные навыки `$cuvslam-onboard` и `$cuvslam-troubleshoot` — для настройки и диагностики компонента оценки состояния.

Если робот ещё не зарегистрирован, `$compass-newembodiment` проводит разработчика через настройку робота, регистрацию окружения, сопоставление действий и визуальный дымовой тест в одной среде.

Подключение нового типа робота — отдельная инженерная задача по сравнению с обучением специалиста для уже зарегистрированного робота. При этом используется тот же подход с проверками и подтверждениями.

Материал заканчивается на этапе оценки контрольной точки. Экспорт в ONNX, JIT или TensorRT, интеграция с ROS 2 и развёртывание на физическом оборудовании требуют отдельной проверки под конкретного робота и среду исполнения.

Качество сцены, продолжительность обучения и результаты контрольной точки зависят от типа робота, окружения, устройства награды и доступных вычислительных ресурсов. Поэтому рабочий процесс не задаёт универсальный порог успеха.

Рекомендуемый порядок расширения — начать с эталонного пути и затем добавлять по одному компоненту за раз.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram