RoboBrain: как робот понимает глубину 3D-сцены и учится самоконтролю

В робототехнике есть старая боль: даже сильные визуальные и языковые модели неплохо рассуждают о сцене, но иногда плохо справляются с тем, чтобы действовать в физическом мире. В быту это выглядит просто: «подвинь кружку на 10 сантиметров вправо» или «лей воду над цветами на высоте 1–5 см». Для человека такие инструкции почти тривиальны, а для робота — минное поле. Нужно не только узнать, где объект на картинке, но и понять реальную глубину, расстояния, ограничения на столкновения и, что не менее важно, постоянно отслеживать: задача продвигается или мы топчемся на месте.
Авторы работы RoboBrain 2.5: Depth in Sight, Time in Mind как раз занимаются этими двумя узкими местами. Они предлагают следующую версию foundation-модели для embodied AI, которая учится точнее мыслить в 3D и лучше чувствовать «темп» выполнения действий.

Глубина в поле зрения: как перейти от 2D-указаний к метрическому 3D
Многие VLM хорошо делают 2D-привязку: когда нужно показать пальцем на объект, выделить область и т.д. Но манипуляции руками требуют другого уровня: «на сколько сантиметров», «на какой высоте», «как провести руку так, чтобы не задеть». В RoboBrain 2.5 это реализовано в идее 3D spatial trace — последовательность ключевых точек, по сути черновик будущей траектории манипулятора.
Ключевой инженерный подход — представление точки как (u, v, d): координаты в изображении плюс абсолютная глубина. Из этого легко восстановить 3D-точку, если известны параметры камеры (что в роботах обычно так и есть). Такой формат не заставляет модель угадывать геометрию камеры и хорошо стыкуется с уже существующими 2D-датасетами: можно временно отбросить глубину или свести задачу к началу/концу.
Обучение построено как учебный план: сначала модель учится находить объекты в 3D, затем измерять метрические величины (зазоры, расстояния), а потом — генерировать след манипуляции, который проходит по сцене без коллизий. Это важный мост между пониманием инструкции и возможностью исполнения.

Время в голове: как понять, продвигаемся ли мы
Вторая часть обновления — dense temporal value estimation. Идея простая: роботу нужна постоянная обратная связь по ходу выполнения, а не только финальная оценка «успех/провал». В реальности робот может застрять, отклониться от цели, сделать шаг назад или попасть в ошибочное состояние. Если модель умеет распознавать эти режимы по видео, её можно использовать как надёжный сигнал для управления в замкнутом контуре и как награду для RL.
Авторы размечают прогресс не грубо по времени, а через нормализованные «прыжки» между состояниями (hop). Это делает сигнал устойчивым: он остаётся в ограниченном диапазоне и меньше расползается при плотной нарезке видео на кадры. Дополнительно используется слияние трёх взглядов на прогресс: пошагового, «от старта» и «от цели». А ещё — проверка согласованности вперёд/назад: если оценки противоречат друг другу, модель снижает доверие к собственному сигналу. Это выглядит как защита от галлюцинаций в неожиданных ситуациях — важная вещь, если дальше вы строите на этом автоматическую награду.

Данные и обучение: ставка на масштаб, но с «физическим смыслом»
RoboBrain 2.5 обучают на примерно 12,4 млн отобранных примеров, где смешаны общие мультимодальные данные, пространственные задания и временные. Особенно выделяется массив для value estimation: исходно десятки миллионов кадров, затем выборка для обучения.
Интересная практическая деталь — инфраструктура: авторы отдельно обсуждают стабильность обучения на длинных последовательностях (там много визуальных токенов), борьбу с фрагментацией памяти и даже кросс-ускорительное обучение (NVIDIA и Moore Threads) с близкой сходимостью. Это сигнал, что модель действительно готовят как производственный артефакт, который можно переносить между платформами.

Что получилось на проверках
По 2D-пространственным бенчмаркам RoboBrain 2.5 заметно обгоняет предшественника RoboBrain 2.0 и ряд универсальных моделей. Но главное — 3D-метрика и задачи с физическими ограничениями. На VABench-V и ShareRobot-T (где важна ошибка расстояния, и меньше — лучше) модель показывает лучшие значения среди сравниваемых.
Во временной части результаты выглядят особенно убедительно из-за проверки «на обратимость времени»: если прокрутить видео назад, адекватная модель должна менять знак прогресса. У многих сильных моделей VOC+ высокий, а VOC- нет — они угадывают направление вместо понимания. RoboBrain 2.5 держится ровно на обоих направлениях на реальных, синтетических и человеческих датасетах, что важно для надёжной обратной связи.

Почему это важно
RoboBrain 2.5 помогает роботам быть устойчивыми, метрически точными и способными понять, что действие пошло не туда — прямо в процессе. Связка 3D-трасс (как понятного промежуточного плана) и плотной оценки прогресса (как постоянного сигнала качества) выглядит хорошей основой для систем, которые должны работать не в лабораторной среде, а в реальном доме, мастерской, заводе или магазине.
ИИ-обзоры статей
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день.
В Telegram