Коротко
Доступные физические ИИ-системы могут помогать людям на производстве, дома и на складах, повышая безопасность, производительность и качество поддержки в самых разных задачах. Физический ИИ работает в открытой и непредсказуемой среде, взаимодействует с другими роботами и людьми и должен адаптироваться к разным конфигурациям роботов.
Для реализации такого подхода нужны достижения сразу в трёх областях:
Аппаратное обеспечение и ИИ-модели в последние годы быстро улучшались, но инфраструктуре инференса физических ИИ-систем уделяли меньше внимания. Для безопасной и эффективной работы роботов в реальном мире потребуется развитая система, способная обрабатывать большие объёмы распределённых вычислений.
Почему вычисления переносят с робота
Сегодня физический ИИ обычно запускают на GPU, установленном непосредственно на роботе. В такой схеме инференс ограничен возможностями бортового устройства, которое передаёт роботу необходимые фрагменты данных и последовательности действий для выполнения задачи. Планирование высокого уровня может проходить в облаке, но выполнение самой задачи обычно остаётся привязанным к роботу.
Авторы исследования оспаривают этот подход. По мере роста размера и сложности физических ИИ-моделей ограничения бортовых вычислений становятся заметнее: GPU потребляют много энергии, сокращают время работы батареи, увеличивают стоимость и массу робота и могут не позволять запускать новые поколения моделей.
Чтобы изучить системные последствия работы физического ИИ, исследователи провели первое систематическое исследование робототехнических нагрузок. Они сосредоточились на мобильной манипуляции и взяли типичную задачу: проверить кухню на наличие мусора, подобрать его и выбросить.
Для этого роботу нужно:
Исследователи оценили типичные модели по трём ключевым направлениям: семантическое картографирование и планирование, навигация и манипуляция.
Перенос инференса физического ИИ за пределы робота улучшил время отклика, точность, время работы батареи и стоимость системы. Модели проверяли на разных конфигурациях бортовых, периферийных и облачных вычислений. Подробности об использованном оборудовании приведены в техническом отчёте.
Производительность роботов
Перенос инференса заметно улучшил работу роботов в задачах картографирования, планирования, навигации и манипуляции. Некоторые небольшие GPU не могли вместить весь стек мобильной манипуляции. На GPU с достаточным объёмом памяти картографирование и планирование выполнялись до 383% медленнее, чем на A100, что ограничивало работу робота в динамичной среде.
На менее производительных GPU навигация на 30% хуже своевременно обнаруживала препятствия. Модели VLA при уменьшении вычислительных ресурсов не замедлялись радикально, но этого снижения скорости хватило, чтобы их точность упала на 50%.
Ключевые результаты:
Таким образом, бортовые GPU ограничивали возможности роботов, тогда как перенос инференса на локальный или облачный GPU улучшал их работу. Это показано в роликах и подтверждено графиками. По мере роста размера и сложности физических ИИ-моделей преимущества такого подхода, как ожидается, будут становиться заметнее.
а: На видео показана задача передачи с использованием бортовых GPU
Источник: microsoft.com
б: На видео показана задача передачи при вынесенном выполнении инференса
Источник: microsoft.com
Время работы от батареи
Бортовые GPU влияли не только на производительность, но и на заряд батареи. Исследователи сравнили время автономной работы при замене бортового GPU на плату Raspberry Pi-5 и передаче всех данных на удалённый GPU.
Источник: microsoft.com
Более крупные бортовые GPU, включая Jetson Thor, сокращали заряд батареи робота до 160%, то есть на несколько часов, даже у более крупных роботов.
Показатели успешности передачи объектов роботизированными манипуляторами друг другу при выполнении инференса с использованием разных GPU (часть на борту, часть с вынесенной обработкой). Вынесенная обработка повышает показатели успешности
Источник: microsoft.com
Влияние вынесенного выполнения инференса на GPU на время работы роботов от батареи; приведённые выше значения относятся к роботу Stretch-3
Источник: microsoft.com
Эти результаты показывают, что перенос GPU-инференса за пределы робота нужен для работы в открытом мире с крупными моделями и длительным временем автономной работы. При этом такой подход связан с компромиссами между производительностью, задержкой и пропускной способностью сети, а также доступными ресурсами GPU.
Авторы считают, что результаты измерений помогут проектировать инфраструктуру инференса для физических ИИ-систем.
Инструменты для автоматического переноса
Microsoft разработала набор инструментов для упрощения переноса инференса за пределы робота и распределения вычислений между периферийным GPU и облаком. Kubernetes выбран как единая платформа для распределения робототехнического ИИ между вычислительными ресурсами робота, периферийным GPU и облаком, если локальных ресурсов не хватает.
Инструменты позволяют:
Последовательность работы показывает, как инструмент получает указание, какие вычисления нужно перенести, создаёт отдельный контейнер для GPU-инференса и отправляет туда те же вычисления.
Этапы набора инструментов для вынесенной обработки с контейнеризацией и развёртыванием
Источник: microsoft.com
Microsoft недавно выпустила Physical AI Toolchain — открытый фреймворк, готовый для промышленной эксплуатации. Он объединяет облачные сервисы Microsoft Azure со стеком физических ИИ-систем NVIDIA и помогает разработчикам робототехники автоматизировать и масштабировать сбор, расширение и оценку данных в дата-пайплайнах восприятия, мобильности, имитационного обучения и обучения с подкреплением.
В состав Physical AI Toolchain добавили возможность переносить инференс физических ИИ-систем роботов. В релиз вошли примеры для роботов SO-101 и UR10e. В роликах показан перенос инференса модели Rho от Microsoft, предназначенной для двуруких роботов, на GPU Jetson Thor. Этот GPU управляет действиями робота Mobile Aloha.
а: Вынесенная обработка инференса на GPU модели Rho компании Microsoft, управляющей роботом Mobile Aloha, при взаимодействии с BusyBox для нажатия синей кнопки
Источник: microsoft.com
б: Вынесенная обработка инференса на GPU модели Rho компании Microsoft, управляющей роботом Mobile Aloha, при взаимодействии с BusyBox для поворота ручки в положение 4
Источник: microsoft.com
Исследователи также сообщили, что уже протестировали функцию переноса инференса на множестве реальных сценариев использования.
Авторы
Читайте также
YouTube Music станет более разговорным благодаря новым функциям ИИ
Инженер Anthropic объяснил, почему Claude стал хуже писать, хотя поумнел
Агенты OpenAI решили одну из сложнейших задач — математики не понимают их «доказательство»
Ситуационный отчёт
Первый робот PitPro для замены шин заработал в Канаде
Ema привлекла $77 млн — ИИ начинает теснить корпоративное ПО и услуги
Как устроен Basecamp Research — ИИ-стартап, превращающий эволюцию в данные для обучения
Spotify даёт ключи от алгоритма рекомендаций: в США запустили Taste Profile
ИИ-помощник Meta Muse вышел с серьёзной уязвимостью безопасности
Alibaba выпустила Qwen Audio 3.1 и новые модели, снизив цены на ИИ-аудио максимум на 95%
Инженер: ИИ сеет хаос — кодеры весь день жмут «Enter», не думая и не понимая код
AT&T автоматизацией избавляется от рабочих мест — и старой телеком-империи
Умные очки Meta уже сеют хаос в Индии
OpenAI наняла сооснователя Patreon Сэма Яма во главе нового подразделения Creator Product
«Мы уже сражаемся в битве вчерашнего дня»: премьер Греции откровенно об ИИ
Бёрнэм: новое британское ведомство даст отпор «информационной войне» России и других стран
Как ИИ вообще может «убить всех людей»? Пять самых вероятных сценариев
Ник Клегг может заработать £30 млн на выходе стартапа дата-центров Nscale на биржу
Snorkel AI утроила оценку до $3,5 млрд на фоне бума спроса на данные для обучения ИИ
C2C заменяет текстовую передачу данных между ИИ-моделями
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram