NVIDIA предложила RoboLab для оценки универсальных политик роботов
Проблемы оценки роботов
Модели для робототехники заметно улучшились. Современные системы умеют по естественным языковым инструкциям брать, переносить, сортировать и перемещать самые разные предметы. Однако чем больше способностей появляется у таких моделей, тем сложнее становится строго оценивать их работу.
Проверки на реальных роботах дорогие, медленные и плохо воспроизводятся, поэтому для массовой оценки обычно используют симуляцию. У существующих бенчмарков при этом есть несколько проблем.
Первая связана с данными и окружением. В большинстве случаев они взяты из одного и того же визуального источника для обучения и проверки политики. Если модель дообучали на симуляционных данных и затем проверяли в той же симуляции, высокий результат показывает лишь то, что она запомнила конкретную конфигурацию. Способность обобщать на другие условия при этом остаётся неясной. Проблема сохраняется и потому, что визуальное качество симуляций пока не сравнялось с изображениями из реального мира.
Подходы по переносу данных из реального мира в симуляцию частично решают эту задачу: они восстанавливают фотореалистичные окружения по снимкам реальных сцен, в том числе с помощью реконструкции на основе гауссовых точек. Но подготовка одной сцены может занимать больше часа, поэтому использовать такой метод для массового тестирования трудно.
Существующие симуляционные бенчмарки страдают от пересечения визуальных и предметно-ориентированных областей задач, низкой реалистичности и высоких накладных расходов на генерацию сцен и задач. Традиционная процедурная генерация сцен часто страдает от низкого качества рендеринга, создавая большие визуальные разрывы между симуляцией и реальностью. Среды, реконструированные в 3D (3DR), делают симули
Источник: developer.nvidia.com
Вторая проблема — создание новых задач. В большинстве бенчмарков набор заданий фиксирован и обновляется редко. Модели быстро достигают максимальных результатов на статичных наборах, и становится сложно понять, какая из них действительно способнее. Если все системы показывают больше 90% успеха на одном и том же бенчмарке, эти цифры теряют информативность.
Практически каждая статья о модели сообщает результаты на этом бенчмарке, но показанное насыщение затрудняет извлечение содержательных выводов о производительности модели

95%-ный интервал Клоппера — Пирсона для вероятности успеха 90%; синие штрихи показывают интервал CP вокруг 90%. Для сужения доверительного интервала с 10 до 2 процентных пунктов требуется примерно в 15 раз больше прогонов (от 70 до 1 030)
Источник: developer.nvidia.com
Источник: developer.nvidia.com

Бенчмарки должны адаптироваться к новым возможностям по мере развития области. Когда производительность на существующем бенчмарке достигает насыщения, наступает время адаптировать и расширять бенчмарк
Источник: developer.nvidia.com
Трёхэтапный процесс генерации сцен, задач и окружений RoboLab
Источник: developer.nvidia.com
Есть и диагностический пробел. Бинарный результат «успех или провал» не объясняет, что именно пошло не так. Робота мог запутать цвет предмета, формулировка инструкции или сместившаяся камера. Непонятно также, выполнил ли он действие эффективно и в соответствии с конкретной языковой командой.
Кроме того, физический движок и политика всегда содержат некоторую случайность. Один показатель успешности по N прогонам почти ничего не говорит о том, насколько можно доверять оценке реальной способности политики. Если робот выполнил задачу 9 раз из 10, это может быть политика с истинной успешностью 90%, а может — с 80% или 95%, которой просто повезло на небольшой выборке.
Для такой оценки NVIDIA рассматривает метод Клоппера—Пирсона. Он строит точный биномиальный доверительный интервал для доли успехов непосредственно на основе биномиального распределения.
При наблюдаемой успешности 90% и 70 прогонах 95-процентный доверительный интервал Клоппера—Пирсона составляет 15,4 процентного пункта: от 80,5% до 95,9%. При 1030 прогонах погрешность уменьшается до диапазона примерно ±2 процентных пункта — от 88,0% до 91,8%. В NVIDIA отмечают, что большинство опубликованных бенчмарков не используют достаточно прогонов, чтобы статистически значимо сравнивать две политики.
Интервал Клоппера — Пирсона — это «точный» метод определения границ биномиальной вероятности успеха
Источник: developer.nvidia.com
Что такое RoboLab
Для решения этих проблем NVIDIA создала симуляционную платформу RoboLab. Она построена вокруг нескольких принципов.
RoboLab повторяет процедуру подготовки реального эксперимента: пользователь размещает предметы, добавляет языковую инструкцию и запускает политику. Достаточно выбрать объекты из библиотеки, расставить их в сцене и указать одну, две или три инструкции для задачи. Весь процесс занимает несколько минут.
В платформу также входят навыки ИИ-агента, которые агент для программирования может использовать для создания новых задач прямо в рабочем процессе пользователя. Благодаря этому бенчмарк можно постоянно обновлять: добавлять новые задания и убирать устаревшие по мере улучшения универсальных моделей.
Создание универсальной политики робота требует решения длинного хвоста специализированных задач, а у одной команды редко есть большой объём данных для всех типов роботов. Лаборатория может располагать тысячами часов данных для манипулятора Franka и почти не иметь данных для гуманоидного робота — или наоборот. Бенчмарк, рассчитанный на одну конкретную конструкцию робота, заставляет всех работать с одним и тем же ограничением, независимо от того, что именно они создают или проверяют.
Задачи RoboLab не привязаны к конкретному роботу или архитектуре политики. Один и тот же набор заданий можно запускать на разных конструкциях и с разными политиками. Пользователь сам выбирает робота и подход, а RoboLab собирает те же сцены и задачи под выбранную систему. По мере роста числа вариантов конструкции роботов это позволяет сосредоточиться на том, решает ли робот задачу, а не на том, какая именно машина использовалась для сбора данных и обучения.
Полезный бенчмарк должен разделять отдельные способности, а не просто фиксировать факт завершения задания. По наблюдениям авторов, универсальные задачи манипуляции опираются как минимум на три разные компетенции.
В RoboLab задачи проектируют так, чтобы каждая проверяла одну или несколько конкретных способностей. Это помогает охватить разные навыки, необходимые универсальной политике. В первом бенчмарке RoboLab-120 собраны 120 задач на захват и перемещение предметов на столе, отобранных людьми. Каждая задача отмечена набором требуемых компетенций, поэтому охват навыков остаётся видимым и сбалансированным. По мере добавления новых заданий этот баланс можно корректировать.
Как RoboLab анализирует ошибки
Одной успешности недостаточно, чтобы понять, как именно робот выполнил задачу. Политика может взять правильный предмет, но уронить его раньше времени — тогда результат будет засчитан как провал. Другая политика способна выполнить задание только после резких, медленных или хаотичных движений — и всё равно получить статус успеха. Бинарная метрика не различает такие случаи.
Поэтому RoboLab использует ещё три инструмента оценки, которые дополняют показатель успешности и дают более подробную картину поведения политики.
Знание причины ошибки не менее важно, чем сам факт провала. Помимо обычных метрик, RoboLab отслеживает, на каком этапе нарушается выполнение задачи. Журнал событий автоматически фиксирует захват неправильного предмета, падение объекта и столкновение захвата с окружением.
Например, в задаче «Убери все пластиковые бутылки в контейнер» политика может подобрать все бутылки и положить их в контейнер, но по дороге добавить туда ещё и апельсин. Формально задача выполнена, однако робот успел схватить неправильный предмет, прежде чем завершить действие. Такой случай показывает, почему одного итогового результата недостаточно.
RoboLab включает встроенную панель мониторинга для просмотра событий во время эпизодов. Это позволяет пользователям быстро увидеть, когда происходят сбои, и понять контекст сбоя
Источник: developer.nvidia.com
Для анализа событий в RoboLab есть встроенная панель. Она показывает происходящее во время эпизода, а пользователь может сразу перейти к кадру, на котором возникла ошибка. Диагностика превращается из ручного разбора после завершения эксперимента в процедуру, похожую на отладчик поведения робота: можно выяснить не только, сработала ли политика, но и где именно она перестала работать и какие условия привели к этому.
Проверка в сложных условиях
В реальном мире нет чистых и полностью контролируемых условий бенчмарка. Люди формулируют инструкции по-разному, сцены часто загромождены, а задача может состоять из длинной последовательности действий. Поэтому устойчивость политики нужно проверять при росте сложности языка, сцены и горизонта задачи.
Робот, который понимает только команды с точной формулировкой, мало полезен за пределами лаборатории. Проверка по нескольким языковым инструкциям показывает, зависит ли политика от конкретных слов или действительно понимает задачу.
В RoboLab можно задать несколько вариантов инструкции и выбрать нужный во время запуска. В начальном бенчмарке предусмотрены три варианта: расплывчатый, стандартный и конкретный. Авторы обнаружили, что расплывчатые инструкции регулярно приводят к ошибкам — современные модели остаются чувствительными к формулировкам. При этом избыток деталей тоже иногда ухудшает результат.
Демонстрация того, как политика испытывает трудности по мере того, как языковые команды становятся более расплывчатыми. Задача состоит в том, чтобы убрать все 3 банана из контейнера, но по мере того, как инструкции становятся более расплывчатыми и требуют большего рассуждения, политика не может понять предполагаемую цель задачи
Источник: developer.nvidia.com
Реальные сцены обычно менее аккуратны, чем обучающие. В них есть лишние предметы, беспорядок и визуальный шум, которые могут мешать распознать цель. Поэтому RoboLab позволяет оценивать, сохраняет ли политика правильный выбор по мере роста числа отвлекающих объектов и общей сложности сцены.
Короткие и длинные задачи
Многие задачи в реальном мире состоят не из одного действия, а из последовательности зависимых подзадач. Небольшая ошибка в начале может привести к полному провалу в конце. Например, чтобы убрать кружки в шкаф, роботу сначала нужно открыть дверцу, а уже затем взять кружку.
В RoboLab разработчик может задать ожидаемую последовательность подзадач и отслеживать, насколько далеко по ней продвинулась политика. Снижение результата при увеличении горизонта показывает, насколько хорошо система сохраняет точность в длинных цепочках рассуждений. Авторы сообщают, что большинство политик испытывает трудности с длинными задачами: ни одна из проверенных систем не смогла успешно выполнить больше четырёх сложных подзадач.
Варианты сцен, которые могут повлиять на производительность. Проверка каждого варианта в одном прогоне экспоненциально увеличивает число экспериментов. Мы вводим анализ чувствительности, который позволяет определить переменные, влияющие на производительность, не проверяя их по отдельности
Источник: developer.nvidia.com
Анализ чувствительности
Некоторые изменения окружения действительно снижают результат, но при масштабном тестировании проверять каждую переменную отдельно становится непрактично. Вместо этого RoboLab одновременно запускает оценки на множестве вариантов сцен и применяет анализ чувствительности. Он показывает, какие параметры окружения чаще всего связаны с успехом или провалом, превращая предположение вроде «возможно, важна позиция камеры» в измеримый результат.
Для прогонов эпизодов с вариацией условий \(\theta\) и наблюдаемым результатом \(x\), например успешным выполнением задачи, используется апостериорное распределение:
\(p(\theta \mid x) \propto p(x \mid \theta)p(\theta)\).
Оно показывает, какие условия \(\theta\) сильнее всего связаны с результатом \(x\). NVIDIA оценивает это распределение с помощью метода нейросетевой оценки апостериорного распределения (NPE). Метод позволяет определить, какая именно переменная окружения вызвала падение результата, вместо того чтобы по очереди проверять влияние каждого фактора.
Вывод
По мнению NVIDIA, бенчмаркинг робототехники пока заметно отстаёт от других направлений исследований ИИ. Без единой отраслевой платформы трудно измерять прогресс. По мере улучшения политик одной успешности будет недостаточно: она не показывает, обобщила ли модель знания или просто запомнила условия проверки.
Для оценки нужны бенчмарки, которые расширяются, а не быстро насыщаются, метрики, объясняющие причины ошибок, и анализ, показывающий исследователям не только качество работы политики, но и способы её улучшения. RoboLab предлагает масштабируемый подход к диагностической оценке политик роботов в симуляции перед применением в реальном мире.
RoboLab разработала команда исследовательского подразделения NVIDIA, в которую входят исследователи, связанные с Сиднейским университетом и Университетом Торонто. Статья и исходный код проекта опубликованы на GitHub.
Исследования RoboLab также используются в открытой программной среде симуляции NVIDIA Isaac Lab-Arena для масштабной подготовки и оценки политик. Ключевые возможности RoboLab планируют добавить в продукт в августе 2026 года.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram