i
ДАТАИСТ
Новости · 2026-08-28

Как обучать навигационную политику для разных роботов с помощью ИИ-агентов

Навигация превращает восприятие и движение робота в автономное выполнение задач: система должна постоянно определять своё положение, понимать изменения вокруг, выбирать маршрут и обходить препятствия. NVIDIA описала рабочий процесс, в котором ИИ-агент для программирования подготавливает данные и сцены, проверяет зависимости, запускает обучение, ищет причины ошибок и сравнивает контрольные точки. В качестве примера используется Boston Dynamics Spot и программная платформа COMPASS: она адаптирует предварительно обученную политику NVIDIA X-Mobility под конкретного робота и окружение с помощью остаточного обучения с подкреплением. Процесс включает сцены из встроенного склада, SAGE-10K и реконструкции Omniverse NuRec, а человек подтверждает ключевые этапы перед продолжением.

Обложка: Как обучать навигационную политику для разных роботов с помощью ИИ-агентов

Как обучать навигации роботов разных конструкций с помощью ИИ-агентов

Навигация превращает восприятие и движение робота в автономное выполнение задач: система должна постоянно определять своё положение, понимать изменения вокруг, выбирать маршрут и обходить препятствия. NVIDIA описала рабочий процесс, в котором ИИ-агент для программирования подготавливает данные и сцены, проверяет зависимости, запускает обучение, ищет причины ошибок и сравнивает контрольные точки. В качестве примера используется Boston Dynamics Spot и программная платформа COMPASS: она адаптирует предварительно обученную политику NVIDIA X-Mobility под конкретного робота и окружение с помощью остаточного обучения с подкреплением. Процесс включает сцены из встроенного склада, SAGE-10K и реконструкции Omniverse NuRec, а человек подтверждает ключевые этапы перед продолжением.

Навигация отличается от локомоции. Локомоция отвечает за устойчивое движение, а навигация должна непрерывно локализовать робота, интерпретировать меняющуюся обстановку, выбирать путь и безопасно обходить препятствия на пути к цели.

Перенос такой способности на нового робота или в новую сцену может потребовать дополнительных данных, ресурсов для симуляции, интерфейсов робота, обучения, диагностики и оценки. Повторять всю эту работу для каждой пары «робот — сцена» дорого и сложно воспроизводимо.

ИИ-агент снижает объём ручных операций. Разработчик задаёт робота, источник сцены и цель навигации. Агент для программирования использует навыки из репозитория, чтобы проверить зависимости, подготовить ресурсы, провести дымовые тесты, запустить обучение, диагностировать сбои и сравнить контрольные точки. Человек подтверждает принятие сцены, односредовый дымовой тест и продвижение контрольной точки на следующий этап.

В качестве эталонного робота используется Spot. В учебном примере рабочий процесс с ИИ-агентом COMPASS применяется к встроенной сцене и сцене SAGE-10K. Также показано, как NVIDIA Omniverse NuRec работает с захваченными окружениями. Рабочий процесс политики проходит через дымовой тест, остаточное обучение, оценку контрольных точек и интеграцию во время выполнения, включая необязательную одометрию.

Что такое COMPASS

COMPASS — это программная платформа «Политика мобильности между конструкциями на основе остаточного RL и синтеза навыков». Она предназначена для масштабируемого обучения мобильности роботов разных конструкций на основе экспертных демонстраций одного робота.

Платформа повторно использует навигационное поведение предварительно обученной политики NVIDIA X-Mobility. Для выбранных робота и окружения обучается остаточный специалист — политика обучения с подкреплением, которая корректирует базовое действие, вместо того чтобы заново осваивать навигацию с нуля. Позже на основе данных нескольких специалистов можно получить единую политику для роботов разных конструкций.

Рабочий процесс с ИИ-агентом обучает и оценивает именно такую архитектуру COMPASS. Сам процесс разработки упакован в виде навыков репозитория. В учебнике для разработки используется Codex. После обучения политика и контроллер робота выполняют навигацию во время работы системы уже без ИИ-агента для программирования.

Эталонный рабочий процесс рассчитан на четвероногого Boston Dynamics Spot. Встроенный склад служит основным воспроизводимым сценарием, SAGE-10K добавляет сгенерированную сцену, а NVIDIA Omniverse NuRec даёт дополнительный путь для реконструированного окружения.

NVIDIA cuVSLAM — библиотека визуальной одометрии и одновременной локализации и построения карты с ускорением CUDA. Она может использоваться при развёртывании, если робот не предоставляет совместимые одометрию и преобразования координат.

встроенный складSAGE-10KOmniverse NuReccuVSLAM

Подготовка репозитория

Для другого окружения нужно использовать закреплённый в репозитории программный набор COMPASS и соответствующее оборудование.

Сначала подготовьте репозиторий и задайте агенту для программирования понятные правила рабочего процесса. До начала работы со сценой потребуется скачать ресурсы с ограниченным доступом, сделать навык COMPASS доступным для Codex, проверить набор программных компонентов и остановиться на односредовом этапе согласования.

Блоки `$compass` — это копируемые запросы для диалога с Codex из корня репозитория COMPASS, а не команды оболочки. В Claude Code тот же процесс запускается командой `/compass`.

В Codex сначала нужно открыть навыки репозитория через `.agents/skills`, а затем выбрать COMPASS с помощью `/skills` или упомянуть `$compass` в запросе. Codex поддерживает каталоги навыков, подключённые символическими ссылками, поэтому текущий навык можно оставить в поддерживаемом репозитории месте. В Claude Code используется тот же рабочий процесс через `/compass`.

ИИ-агент может клонировать репозиторий, собирать проект, скачивать ресурсы без секретов и проверять набор программных компонентов. Условия доступа к репозиториям должен принять разработчик, он же вводит токен Hugging Face вне диалога. Агент не должен запрашивать, показывать или сохранять этот токен в журналах.

Сначала нужно клонировать репозиторий COMPASS и пройти краткое руководство из COMPASS Handbook в контейнере, закреплённом в репозитории. До первого запуска следует принять доступ к закрытым репозиториям Hugging Face `nvidia/COMPASS` и `nvidia/X-Mobility`, создать токен Hugging Face только для чтения и проверить, что он позволяет читать доступные вашей учётной записи публичные репозитории с ограниченным доступом.

Токен нужно сделать доступным только в текущей оболочке. Его нельзя вставлять в запрос агенту или добавлять в систему контроля версий.

Этап загрузки ресурсов сохраняет зарегистрированные ресурсы симуляции в `./assets/usd/`, а предварительно обученную контрольную точку X-Mobility — в `./assets/x_mobility.ckpt`. Ответ 401 или 403 обычно означает, что доступ к репозиторию не оформлен полностью либо у токена недостаточные права. Сначала нужно исправить аутентификацию и только потом искать проблему в Isaac Lab.

Каждый этап должен создавать проверяемые свидетельства до перехода к следующему. Критерии согласования зависят от проекта, но на каждом этапе нужно ответить на четыре вопроса: все ли требуемые входные данные на месте, появились ли ожидаемые результаты, остались ли нерешённые ошибки и достаточно ли свидетельств для продолжения.

После запуска контейнера откройте ИИ-агента в корне репозитория и опишите робота, сцену, требуемый результат навигации и этапы, на которых нужно одобрение человека.

Навык `$compass` проверяет запрошенный рабочий процесс по репозиторию и запускает необходимые проверки. Если запуск завершается ошибкой, `$compass-doctor` выполняет проверку состояния только для чтения и сообщает вероятные причины, не меняя окружение без разрешения.

Выбор сцены

Есть три источника сцен:

встроенный склад COMPASS;
сгенерированная сцена SAGE-10K;
захваченное окружение, обработанное NVIDIA Omniverse NuRec.

Для самого быстрого воспроизводимого базового сценария рекомендуется зарегистрированный склад `combined_multi_rack`. Робот, сцена и карта занятости уже зарегистрированы, поэтому этот путь подходит для проверки установки перед добавлением новой сцены.

После подготовки сцены агент должен выполнить предварительный запуск в одном окружении и остановиться после дымового теста.

SAGE-10K

Набор данных SAGE-10K содержит 10 000 сгенерированных интерьерных сцен 50 типов помещений. Это набор сцен, а не политика и не симулятор. Каждая сцена включает геометрию, материалы, метаданные планировки и предварительный просмотр.

Сцены гостиных и складов подготавливаются одинаково, поэтому скачивать весь набор данных не требуется: достаточно выбрать подходящий вариант.

Путь SAGE-10K включает два этапа одобрения человеком. Сначала нужно открыть преобразованный файл USD в NVIDIA Isaac Sim и проверить геометрию, материалы, масштаб и сетки столкновений перед регистрацией. После регистрации и создания карты занятости нужно одобрить предварительный просмотр одного окружения перед полноценным обучением.

Карта занятости показывает свободное и заблокированное пространство, в котором можно выбирать допустимые начальные положения робота и цели навигации.

Omniverse NuRec

Omniverse NuRec используется, если нужно дообучить и оценить COMPASS в реконструкции окружения, где планируется развёртывание. NuRec преобразует стереоскопические изображения RGB в реконструкцию, совместимую с Isaac Sim, с согласованной визуальной геометрией, сетками столкновений и возможностью дополнительного редактирования сцены.

Документированный путь COMPASS для такой сцены включает её регистрацию, проверку предоставленной карты занятости и соглашения об исходной системе координат, проверку зазоров для робота и односредовый дымовой тест перед обучением.

NuRec в этом материале остаётся дополнительным вариантом. Практическое обучение продолжается на SAGE-10K, чтобы провести одну сцену через подготовку и оценку. Для захваченного окружения нужно использовать рабочий процесс COMPASS NuRec и руководство NVIDIA Isaac Sim NuRec, включая пример с гостиной. Они описывают подготовку сцены, обучение, оценку, экспорт и развёртывание в ROS 2.

Дымовой тест

Когда выбранная сцена становится доступна COMPASS, перед масштабированием обучения нужно запустить предварительный просмотр в одном окружении. Для SAGE-10K сначала необходимо завершить визуальную проверку и согласование регистрации сцены.

Нужно убедиться, что:

Isaac Sim запускается;
сцена загружается;
Spot появляется в допустимом месте;
доступны изображения с камер;
робот реагирует на команды политики;
робот не задевает объекты, не падает и не создаёт нерешённых ошибок симуляции.

ИИ-агент должен свести в отчёт журналы предварительного запуска и визуальные свидетельства, указать блокирующие проблемы и остановиться для одобрения человеком. К остаточному обучению можно переходить только после проверки совместной работы сцены, робота, наблюдений и интерфейса действий.

Остаточное обучение

COMPASS адаптирует предварительно обученную политику X-Mobility к выбранным роботу и сцене. После одобрения односредового дымового теста агент может запустить стандартный рабочий процесс остаточного обучения с подкреплением.

Пример использует Spot и встроенный склад. При работе со сценой SAGE-10K ключ окружения нужно заменить на зарегистрированную сцену SAGE-10K.

Остаточное обучение может продолжаться долго. Агенту следует запускать его в постоянном сеансе или через управляемый планировщик, записывать журналы и контрольные точки в настроенный каталог результатов и сообщать о ходе работы, не удерживая открытым интерактивный сеанс.

До запуска обучения нужно зафиксировать:

команду;
ревизию репозитория;
ключ сцены;
конфигурацию;
интервал сохранения контрольных точек;
критерии остановки.

Если запуск прерван, необходимо проверить целостность последней контрольной точки и поддерживаемые параметры продолжения обучения.

Параметр `--num_envs` следует выбирать с учётом доступной памяти GPU. Для дымового теста используется только одно окружение. Во время обучения нужно отслеживать компоненты награды, продвижение к цели, контакты и падения, завершения эпизодов, скорость обработки и использование памяти GPU.

Контрольные точки следует сохранять периодически и оценивать в одинаковых условиях, не предполагая, что лучшей окажется последняя итерация. COMPASS также поддерживает распределённое обучение на нескольких GPU для более крупных запусков. Длительность обучения зависит от оборудования, сложности сцены, количества окружений и критериев остановки.

При сбоях следует сначала использовать диагностический рабочий процесс COMPASS и только потом менять окружение или конфигурацию обучения. Ошибки аутентификации нужно направлять к проверке доступа Hugging Face, ошибки загрузки сцены и столкновений — к подготовке сцены, проблемы с камерами или интерфейсом действий — к этапу дымового теста, а ошибки памяти — к настройке количества окружений или нескольких GPU.

Нужно сохранить конфигурацию обучения, команду запуска, ревизию репозитория, регистрацию сцены, карту занятости, свидетельства дымового теста, журналы, контрольные точки и манифест артефактов. Перед изменением зависимостей, ресурсов сцены, наград или настроек обучения требуется одобрение разработчика.

Оценка контрольных точек

После обучения нужно определить, готова ли остаточная контрольная точка к продвижению. Для этого предварительно обученную базовую политику и кандидатов на основе остаточного обучения сравнивают в одинаковых условиях.

Стандартная оценка COMPASS включает:

долю достигнутых целей;
долю падений;
время прохождения маршрута.

Дополнительные сведения — продвижение к цели, поведение при контактах, истечения времени ожидания и стабильность команд — нужно помечать как производный анализ или данные пользовательской инструментации.

Контрольную точку можно продвигать только после того, как согласованные результаты проходят проектные требования по навигации и безопасности, а человек одобряет упаковку.

Интеграция во время работы

После завершения разработки обученная политика подключается к рабочей системе робота. ИИ-агент координирует разработку и проверку, но не управляет роботом во время работы.

Этап загрузки ресурсов COMPASS скачивает предварительно обученную контрольную точку X-Mobility для дымового теста и остаточного обучения. Обучение создаёт остаточную контрольную точку для выбранных робота и сцены. Экспорт и развёртывание упаковывают обученную политику для инференса: базовую и остаточную политики не нужно вручную подключать как два отдельных компонента ROS 2.

В эталонной интеграции ROS 2 компонент `compass_inference` преобразует изображения с передней камеры, навигационную цель или маршрут и скорость робота, рассчитанную по одометрии, во входы экспортированной политики. Он публикует команды линейной скорости вперёд и угловой скорости в `/cmd_vel`.

Рекуррентное состояние и предыдущее действие являются внутренними данными реализации инференса и не относятся к внешним входам интеграции ROS. Для целевого развёртывания нужно проверить системы координат, частоты обновления, нормализацию, ограничения команд, поведение при остановке и контроллер физического робота.

Одометрия с cuVSLAM

Библиотека cuVSLAM нужна, если роботу требуется оценка состояния по камере в окружении без GPS или с нестабильным GPS, а сам робот не предоставляет совместимые и проверенные одометрию и преобразования координат.

Одометрия cuVSLAM может поддерживать навигатор COMPASS, но карта cuVSLAM не подаётся на вход навигационной политики.

cuVSLAM не используется при обучении политики COMPASS и не требует навыка агента. Библиотеку нужно запускать как отдельный компонент ROS 2 с согласованными версиями, подключить или перенаправить её одометрию в `/chassis/odom`, передать требуемое преобразование `odom` в `base_link`, а также проверить калибровку, временные метки, имена каналов и соглашения о системах координат.

Во время разработки настроить и диагностировать этот компонент могут дополнительные навыки `$cuvslam-onboard` и `$cuvslam-troubleshoot`.

Новый робот

Если робот ещё не зарегистрирован, навык `$compass-newembodiment` проводит разработчика через настройку робота, регистрацию окружения, сопоставление действий и односредовый визуальный дымовой тест.

Подключение нового типа робота — отдельная инженерная задача по сравнению с обучением специалиста для уже поддерживаемого робота. При этом используется тот же порядок проверок и одобрений.

Учебник заканчивается на этапе оценки контрольных точек. Экспорт в ONNX, JIT или TensorRT, интеграция с ROS 2 и развёртывание на физическом оборудовании требуют отдельных проверок для конкретных робота и среды выполнения.

Качество сцены, длительность обучения и результаты контрольной точки зависят от конструкции робота, окружения, структуры награды и доступных вычислительных ресурсов. Поэтому рабочий процесс не устанавливает универсальный порог успеха.

Для воспроизведения и расширения рабочего процесса рекомендуется начать с эталонного сценария, а затем добавлять по одному компоненту за раз.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram