i
ДАТАИСТ
Обзор · 2026-01-25

RoboBrain: как робот понимает глубину 3D-сцены и учится самоконтролю

RoboBrain: как робот понимает глубину 3D-сцены и учится самоконтролю

В робототехнике есть старая боль: даже сильные визуальные и языковые модели неплохо рассуждают о сцене, но иногда плохо справляются с тем, чтобы действовать в физическом мире. В быту это выглядит просто: «подвинь кружку на 10 сантиметров вправо» или «лей воду над цветами на высоте 1–5 см». Для человека такие инструкции почти тривиальны, а для робота — минное поле. Нужно не только узнать, где объект на картинке, но и понять реальную глубину, расстояния, ограничения на столкновения и, что не менее важно, постоянно отслеживать: задача продвигается или мы топчемся на месте.

Авторы работы RoboBrain 2.5: Depth in Sight, Time in Mind как раз занимаются этими двумя узкими местами. Они предлагают следующую версию foundation-модели для embodied AI, которая учится точнее мыслить в 3D и лучше чувствовать «темп» выполнения действий.

Новые возможности RoboBrain 2.5: точное 3D-пространственное рассуждение и плотная временная оценка прогресса, а также суммарный прирост на бенчмарках.

Глубина в поле зрения: как перейти от 2D-указаний к метрическому 3D

Многие VLM хорошо делают 2D-привязку: когда нужно показать пальцем на объект, выделить область и т.д. Но манипуляции руками требуют другого уровня: «на сколько сантиметров», «на какой высоте», «как провести руку так, чтобы не задеть». В RoboBrain 2.5 это реализовано в идее 3D spatial trace — последовательность ключевых точек, по сути черновик будущей траектории манипулятора.

Ключевой инженерный подход — представление точки как (u, v, d): координаты в изображении плюс абсолютная глубина. Из этого легко восстановить 3D-точку, если известны параметры камеры (что в роботах обычно так и есть). Такой формат не заставляет модель угадывать геометрию камеры и хорошо стыкуется с уже существующими 2D-датасетами: можно временно отбросить глубину или свести задачу к началу/концу.

Обучение построено как учебный план: сначала модель учится находить объекты в 3D, затем измерять метрические величины (зазоры, расстояния), а потом — генерировать след манипуляции, который проходит по сцене без коллизий. Это важный мост между пониманием инструкции и возможностью исполнения.

Пример TraceSpatial-Bench: показаны истинные start/end и 2D-проекция предсказанной 3D-траектории RoboBrain 2.5.

Время в голове: как понять, продвигаемся ли мы

Вторая часть обновления — dense temporal value estimation. Идея простая: роботу нужна постоянная обратная связь по ходу выполнения, а не только финальная оценка «успех/провал». В реальности робот может застрять, отклониться от цели, сделать шаг назад или попасть в ошибочное состояние. Если модель умеет распознавать эти режимы по видео, её можно использовать как надёжный сигнал для управления в замкнутом контуре и как награду для RL.

Авторы размечают прогресс не грубо по времени, а через нормализованные «прыжки» между состояниями (hop). Это делает сигнал устойчивым: он остаётся в ограниченном диапазоне и меньше расползается при плотной нарезке видео на кадры. Дополнительно используется слияние трёх взглядов на прогресс: пошагового, «от старта» и «от цели». А ещё — проверка согласованности вперёд/назад: если оценки противоречат друг другу, модель снижает доверие к собственному сигналу. Это выглядит как защита от галлюцинаций в неожиданных ситуациях — важная вещь, если дальше вы строите на этом автоматическую награду.

Примеры предсказаний прогресса: покадровые Hop и накопленный Progress на разных задачах.

Данные и обучение: ставка на масштаб, но с «физическим смыслом»

RoboBrain 2.5 обучают на примерно 12,4 млн отобранных примеров, где смешаны общие мультимодальные данные, пространственные задания и временные. Особенно выделяется массив для value estimation: исходно десятки миллионов кадров, затем выборка для обучения.

Интересная практическая деталь — инфраструктура: авторы отдельно обсуждают стабильность обучения на длинных последовательностях (там много визуальных токенов), борьбу с фрагментацией памяти и даже кросс-ускорительное обучение (NVIDIA и Moore Threads) с близкой сходимостью. Это сигнал, что модель действительно готовят как производственный артефакт, который можно переносить между платформами.

Распределение обучающих данных: общий домен, пространственные задачи и крупный блок временной разметки, включая Dense Value Estimation.

Что получилось на проверках

По 2D-пространственным бенчмаркам RoboBrain 2.5 заметно обгоняет предшественника RoboBrain 2.0 и ряд универсальных моделей. Но главное — 3D-метрика и задачи с физическими ограничениями. На VABench-V и ShareRobot-T (где важна ошибка расстояния, и меньше — лучше) модель показывает лучшие значения среди сравниваемых.

Во временной части результаты выглядят особенно убедительно из-за проверки «на обратимость времени»: если прокрутить видео назад, адекватная модель должна менять знак прогресса. У многих сильных моделей VOC+ высокий, а VOC- нет — они угадывают направление вместо понимания. RoboBrain 2.5 держится ровно на обоих направлениях на реальных, синтетических и человеческих датасетах, что важно для надёжной обратной связи.

Устойчивость оценок прогресса при разной частоте кадров: кривые хорошо совпадают, модель не привязана к конкретной дискретизации.

Почему это важно

RoboBrain 2.5 помогает роботам быть устойчивыми, метрически точными и способными понять, что действие пошло не туда — прямо в процессе. Связка 3D-трасс (как понятного промежуточного плана) и плотной оценки прогресса (как постоянного сигнала качества) выглядит хорошей основой для систем, которые должны работать не в лабораторной среде, а в реальном доме, мастерской, заводе или магазине.

💾 Код

ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день.

В Telegram