i
ДАТАИСТ
Новости · 2026-08-31

Как дообучать модели автономного вождения в замкнутом контуре с NVIDIA Alpamayo

@neuronium_ai @neuronium_ai

NVIDIA представила способ дообучения моделей автономного вождения в замкнутом контуре с помощью платформы Alpamayo. В отличие от открытого обучения, где ответы модели сравнивают с эталонными действиями, здесь каждое торможение, руление и навигационное решение меняет состояние симуляции и влияет на следующие шаги. Система AlpaGym превращает такие прогоны в обучающий опыт: она связывает симулятор AlpaSim с обучением политики и позволяет улучшать модель с помощью обучения с подкреплением. В качестве примера NVIDIA использует Alpamayo 1.5 с 10 млрд параметров.

Обложка: Как дообучать модели автономного вождения в замкнутом контуре с NVIDIA Alpamayo

NVIDIA показала, как дообучать модели автономного вождения в симуляции

Разрыв между обучением и работой

Разработка политик для автономных транспортных средств требует связать обучение с реальными условиями работы. Модели «зрение — язык — действие», которые умеют рассуждать в сложных дорожных сценах и формировать подробные промежуточные рассуждения, в основном обучают в открытом контуре. В таком режиме ответы модели напрямую сравнивают с эталонным поведением, не учитывая их влияние на окружающую среду.

В реальной эксплуатации политика управления работает в замкнутом контуре: каждое торможение, движение рулём или решение о навигации меняет ситуацию на дороге. Небольшие ошибки при этом могут постепенно накапливаться.

Для решения этой проблемы NVIDIA предлагает Alpamayo — открытую платформу с моделями ИИ, средствами моделирования и наборами данных для разработки автономных транспортных средств. В её состав входят симулятор AlpaSim и система обучения в замкнутом контуре AlpaGym.

AlpaGym расширяет обычный процесс дообучения: результаты прогонов в AlpaSim становятся обучающим опытом. Симуляция здесь используется не только для финальной проверки — её обратная связь напрямую поступает в цикл обучения политики.

Сквозной рабочий процесс постобучения модели вождения, такой как Alpamayo, с использованием AlpaGym

Источник: developer.nvidia.com

Обучение с подкреплением позволяет улучшать политику, которую изначально обучали в открытом контуре. Модель оптимизируется не только по записанным траекториям экспертов, но и по последствиям собственных действий в симуляции.

В автономном вождении это особенно важно: небольшая ошибка в предсказании или планировании может повлиять на следующие состояния среды. Замкнутое обучение помогает обнаруживать такие сценарии, которые могут оставаться незаметными при проверке по статическим наборам данных или в открытом контуре.

Однако запуск обучения с подкреплением в замкнутом контуре связан с техническими сложностями. Параллельно должны работать инференс модели, симуляция, обучение, синхронизация обновлённых весов, обмен данными и взаимодействие между экземплярами. Для этого нужны управление взаимодействием компонентов и эффективное использование вычислительных ресурсов.

AlpaGym обеспечивает крупномасштабное обучение в замкнутом цикле, в ходе которого модели вождения учатся на последствиях собственных действий в самых разных смоделированных сценариях, значительно сокращая разрыв между обучением и развёртыванием

Источник: developer.nvidia.com

Что такое AlpaGym

AlpaGym связывает обучение политики с замкнутыми прогонами в AlpaSim и предоставляет открытую высокопроизводительную программную платформу для обучения с подкреплением. Система объединяет микросервисы симулятора AlpaSim, открытые наборы данных NVIDIA по физическому ИИ и распределённую систему обучения Cosmos-RL.

Система масштабируется от одной GPU до кластеров с несколькими узлами. AlpaGym использует асинхронный и стабильный распределённый конвейер обучения с подкреплением, не требуя изменений в пользовательском коде. AlpaSim и Cosmos RL выступают средой выполнения и уровнем управления взаимодействием компонентов, алгоритмом по умолчанию служит GRPO, а в комплект входят эталонные функции вознаграждения, проверенные на моделях Alpamayo и наборе данных Physical ИИ AV NuRec.

Подготовка окружения

Для работы NVIDIA рекомендует графический процессор с поддержкой CUDA и минимум 40 ГБ видеопамяти, а также примерно 100–150 ГБ свободного места на диске. В этот объём входят окружение, образы контейнеров и около 21 ГБ весов. Для каждой сцены NuRec требуется примерно 1,5 ГБ; полный набор public_2601 занимает около 1,5 ТБ.

40 ГБминимальный объём видеопамяти
100–150 ГБсвободное место на диске
1,5 ГБодна сцена NuRec
1,5 ТБполный public_2601

AlpaGym устанавливают из репозитория Alpamayo. На хосте нужно установить собственные зависимости CUDA и Redis, после чего синхронизировать рабочее пространство uv. Среда Python управляется через uv, а cuDNN, NCCL и исполняемый файл redis-server используются как зависимости хоста для набора компонентов CUDA и Cosmos-RL. В качестве альтернативы NVIDIA предоставляет подходящий файл Dockerfile. Для загрузки файлов сцен потребуется авторизация в Hugging Face.

При постобучении в замкнутом цикле с помощью AlpaGym хост-процесс запускает AlpaSim, рабочие процессы прогонов предоставляют драйверы политики, AlpaSim выполняет сеансы симулятора, а AlpaGym возвращает тренеру артефакты прогонов и награды

Источник: developer.nvidia.com

Запуск AlpaGym описывается конфигурацией Hydra. В ней указывают контрольную точку политики, набор сцен AlpaSim, степень параллелизма прогонов, функцию вознаграждения и параметры обучения Cosmos-RL. В этом сценарии исходной контрольной точкой служит модель Alpamayo.

Настройка вознаграждения

Функция вознаграждения должна соответствовать поведению, которое требуется улучшить в замкнутом контуре. Для дообучения качества траекторий можно учитывать прогресс, удержание полосы, предотвращение столкновений, долю съездов с дороги, комфорт и расстояние до эталонной траектории.

В качестве первого варианта NVIDIA предлагает простую комбинацию: поощрять прогресс и одновременно штрафовать за критические нарушения безопасности. В AlpaGym такую функцию можно задать как небольшую сумму нескольких компонентов, по возможности используя метрики AlpaSim.

После стабилизации конвейера к вознаграждению добавляют более точные компоненты для тех типов ошибок, которые обнаруживаются по видео и метрикам AlpaSim.

Запуск обучения

AlpaGym поддерживает модель Alpamayo 1.5 с 10 млрд параметров. Она используется в качестве примера; подробные инструкции по подключению собственной модели автономного вождения опубликованы в репозитории NVlabs/alpagym.

Сначала нужно скачать контрольную точку Alpamayo 1.5 и преобразовать её в формат, совместимый с AlpaGym.

После этого AlpaGym запускается вместе с AlpaSim на двух GPU. NVIDIA проверяла такой вариант на конфигурации из двух RTX 6000 Ada по 50 ГБ. Модель с 10 млрд параметров не помещается на одной GPU. Скрипт дистилляции в контрольную точку, подходящую для одной GPU, пока только планируется. Примеры масштабирования на несколько GPU, включая конфигурации с одним или несколькими узлами, приведены в репозитории NVlabs/alpagym.

Одна GPUмодель с 10 млрд параметров не помещается
Две RTX 6000 Ada по 50 ГБпроверенная конфигурация

Во время обучения AlpaGym запрашивает у AlpaSim прогоны сцен, собирает данные по каждому эпизоду, рассчитывает вознаграждения и обновляет политику. Среди полезных сигналов — среднее вознаграждение, его дисперсия, частота ошибок, потери политики, пропускная способность прогонов и разрыв между созданными прогонами и весами последней версии политики.

В этом сценарии собранные данные прогонов и сигналы обучения становятся основными результатами дообучения. Они позволяют проверить, корректно ли работает обучение в замкнутом контуре, и выбрать контрольные точки для последующей проверки на собственных отложенных наборах сценариев AlpaSim. Артефакты запусков сохраняются в `tmp/alpagym-runs/`, а результаты Hydra — в `outputs/`.

Проверка после обучения

После завершения обучения AlpaGym сохраняет экспорт Cosmos-RL в формате safetensors в каталоге `tmp/alpagym-runs/`. Драйвер AlpaSim не может загрузить этот файл напрямую, поэтому сначала его нужно преобразовать в формат для инференса — обратным образом относительно преобразования контрольной точки на третьем шаге.

Затем преобразованную контрольную точку запускают на репрезентативном сценарии. Это позволяет проверить, правильно ли соединены политика, драйвер и симуляционный цикл, а также посмотреть, как собственные действия модели влияют на следующее состояние среды. Для оценки требуется доступ к закрытой модели, объединяющей зрение и язык, `nvidia/Cosmos-Reason2-8B`: драйвер использует её для восстановления исходного токенизатора и препроцессора.

Замкнутый прогон даёт несколько качественных сигналов: насколько стабильны траектории, остаётся ли модель в пределах проезжей зоны, как она реагирует на других участников движения и какие типы ошибок следует исправлять во время дообучения.

Прогон модели автономного транспортного средства в замкнутом цикле в AlpaSim, включая визуализацию с камеры, предсказанную траекторию и диагностику на уровне прогона

Источник: developer.nvidia.com

С такой контрольной точкой команды могут изучать видео прогонов, метрики отдельных эпизодов, кривые вознаграждения и собранные случаи ошибок. Эти материалы помогают отлаживать дизайн вознаграждения, проверять стабильность прогонов и выбирать контрольные точки для последующей проверки на отложенных сценариях в AlpaSim.

Вывод

Дообучение в замкнутом контуре даёт практический способ улучшать сквозные политики управления автомобилем. В представленном сценарии AlpaGym использует прогоны AlpaSim для обучения политик в симуляции, позволяя им учитывать последствия собственных действий.

Эти инструменты можно применять вместе с другими компонентами открытой платформы NVIDIA Alpamayo для разработки моделей с рассуждением, которые можно запускать, анализировать и дообучать в симуляции с замкнутым контуром. Тот же подход можно расширять с помощью собственных функций вознаграждения, сценариев и наборов для оценки.

Для оценки модели в публичной таблице лидеров NVIDIA запустила на CVPR 2026 два открытых соревнования по автономному вождению. Дополнительные материалы доступны в репозиториях NVlabs/alpamayo-recipes и NVlabs/alpagym.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram