Meta помогает Университету Питтсбурга развивать ассистивную робототехнику
В Питтсбурге Лаборатория инженерии человека при Университете Питтсбурга вместе с ATDev разрабатывает роботизированную платформу RAMMP для людей с инвалидностью. Проект получил до $41,5 млн от американского агентства ARPA-H. Платформа объединит робототехнику, ИИ, цифровых двойников и ориентированное на пользователя проектирование. Для восприятия окружающей среды команда использует открытые модели Meta DINO и Segment Anything Model (SAM), а запускать их планирует непосредственно на роботизированных устройствах — без постоянной зависимости от сети.
Для примерно 5,5 млн пользователей инвалидных колясок в США сохранение мобильности напрямую связано с возможностью работать, учиться и участвовать в повседневной жизни. Если ассистивная техника плохо справляется со сложностью реального мира, это снижает самостоятельность и повышает риск травм. Ежегодно в американские отделения неотложной помощи обращаются более 100 000 человек из-за травм, связанных с инвалидными колясками, часто после спотыканий и падений. Поэтому таким устройствам нужны более безопасные, адаптивные и быстрые системы.

Источник: ai.meta.com
Что такое RAMMP
Проект «Роботизированная платформа ассистивной мобильности и манипуляций для обеспечения независимости людей с инвалидностью» — RAMMP — создан при поддержке ARPA-H. Он должен устранить ограничения нынешних роботизированных платформ для передвижения за счёт сочетания современной робототехники, новой операционной системы и цифрового двойника.
Цифровой двойник создаёт виртуальную среду, где системы можно безопасно и масштабируемо проверять и дорабатывать. В состав платформы также входят ИИ-модели для анализа изображений, в том числе открытые модели Meta DINO и Segment Anything Model (SAM).
DINO уже применялась в проектах от медицинской визуализации до охраны дикой природы. Это трансформер для компьютерного зрения с самообучением: он извлекает визуальные представления из неразмеченных данных, что особенно удобно там, где мало размеченных наборов.
SAM предназначена для сегментации объектов. Она может находить и обводить практически любой объект на изображении или видео, получая минимальную подсказку. Благодаря этому модель используют в задачах, где требуется точно распознавать отдельные объекты.

Источник: ai.meta.com
DINOv3 и SAM на устройствах
Для людей, которые зависят от ассистивных устройств, важна каждая секунда. На тротуаре может внезапно появиться ребёнок, на пути — бордюр, а рядом со столом — упавшие ключи. Такие ситуации требуют немедленной реакции.
Обработка изображений с камер и данных датчиков непосредственно на устройстве, то есть периферийный инференс, позволяет роботизированной платформе быстрее реагировать на происходящее. При этом система должна стабильно работать в разных и постоянно меняющихся условиях повседневной жизни.
Запуск DINOv3 и SAM на компактном оборудовании с аккумулятором создаёт отдельные инженерные сложности. Разработчикам приходится учитывать время работы батареи, отвод тепла, нестабильное подключение к сети, а также ограничения по размеру и весу устройства.
Но сама по себе скорость моделей не решает задачу, если человек не может с их помощью выполнять обычные повседневные действия. Новые подходы позволяют взаимодействовать с роботом естественнее: использовать окружающую обстановку как контекст и отдавать команды с помощью языка и изображения.
Например, пользователь может описать нужный объект или указать на него, а система сопоставит команду с тем, что видят камеры робота. Это уменьшает когнитивную нагрузку и число переключений между разными режимами управления даже в простой ситуации — например, когда нужно поднять чашку со стола.
Команда RAMMP уже встраивает такую функциональность в первый прототип. Инструменты на основе DINO позволяют запрашивать данные с камер робота и находить кнопки автоматических дверей, чашки, бордюры и поверхность земли для навигации.
Теперь система готовится к испытаниям в реальных условиях. Инженеры добавляют голосовой и сенсорный ввод, чтобы пользователь мог выбирать конкретные объекты вокруг себя и взаимодействовать с ними. При этом необходимо обеспечить точность и временную согласованность результатов моделей, а также предсказуемую работу при разных командах и способах ввода.
DINOv3 выступает в роли компактного и экономичного «зрительного мозга» устройства. На её основе можно создавать лёгкие специализированные модули для обнаружения объектов, отслеживания движения и других действий. Повторное использование визуальных данных помогает экономить вычислительные ресурсы и заряд батареи.
При подготовке моделей для робототехнических систем инженеры уменьшают занимаемый ими объём памяти, при необходимости используют более низкую точность вычислений и применяют форматы, рассчитанные на реальные условия эксплуатации. Благодаря подходящему разрешению изображений и эффективной пакетной обработке DINOv3 и SAM сохраняют скорость и стабильность даже на компактном оборудовании роботизированных платформ и манипуляторов.
Иногда ради скорости приходится немного жертвовать точностью границ объектов или детализацией признаков. Для пользователей, которые перемещаются в реальном мире, приоритетом остаётся стабильная работа системы.
По словам Sivashankar Sivakanthan, руководителя аппарата проекта RAMMP, ассистивную робототехнику нельзя оценивать только по точности на бенчмарках. Важнее, может ли система надёжно работать в непредсказуемых бытовых условиях. Запуск DINOv3 и SAM непосредственно на устройстве даёт восприятие в реальном времени, не требующее постоянного подключения к сети и не создающее дополнительных рисков для безопасности.

Источник: ai.meta.com
Как работает система восприятия
В основе системы восприятия RAMMP лежит лёгкая модель обнаружения RF-DETR, дообученная с использованием эмбеддингов DINOv2. Обучающие данные автоматически размечаются с помощью SAM. Это позволяет быстро создавать качественные аннотации для разных углов обзора, высот камер, фонов и условий освещения, с которыми ассистивные устройства сталкиваются в реальном мире.
Дополнительные преобразования данных и стратегии с несколькими ракурсами помогают сохранять согласованность результатов при смене перспективы. В итоге система должна адаптивно распознавать обстановку и поддерживать более безопасное передвижение.
Связка SAM для разметки, визуальных представлений DINOv2 и дообученной RF-DETR обеспечивает восприятие окружающей среды на 360 градусов и обнаружение объектов в реальном времени.

Источник: ai.meta.com
Партнёры проекта
HERL и ATDev работают в консорциуме RAMMP как ключевые партнёры, отвечая за разные части проекта. HERL руководит инициативой и использует опыт в биомедицинской инженерии и исследованиях с участием пользователей, формируя направление развития ассистивной мобильности.
ATDev отвечает за инженерную реализацию и переносит исследования HERL в устройства, способные работать в реальных условиях. Вместе организации соединяют академическую работу с разработкой практических решений для мобильности.
HERL также привлекает к проектированию пользователей инвалидных колясок, врачей и общественные организации. Такой подход позволяет учитывать реальные потребности людей, а не только заранее предполагаемые сценарии.
В национальный консорциум RAMMP входят Kinova Robotics, LUCI Mobility, ATDev, а также исследователи из Carnegie Mellon, Cornell, Northeastern и Purdue.
По словам Mansoor Khan, руководителя программы ARPA-H, проект должен помочь американцам с ограниченной мобильностью самостоятельно жить, работать и проводить свободное время. Он отметил, что модели зрения Meta позволяют роботизированной платформе видеть сцену, ориентироваться в окружающем пространстве и выбирать нужные объекты, снижая когнитивную нагрузку на пользователя.
Помимо индивидуальной мобильности, RAMMP должен поддержать появление новых рабочих мест и производственных возможностей в Питтсбурге и по всей Пенсильвании. Проект предполагает развитие ассистивных решений и их производства внутри страны.
Alicia Jackson, доктор философии и директор ARPA-H, заявила, что людям с ограниченной мобильностью нужны технологии, которые подстраиваются под их реальные условия, а не требуют от них адаптироваться к возможностям устройства. По её словам, сотрудничество с Meta помогает быстрее внедрять передовые модели ИИ в ассистивную робототехнику.
Дальнейшая разработка
Команда RAMMP продолжит внедрять модели восприятия следующего поколения, включая SAM 3.1 и DINOv3. Основные направления работы — повышение временной согласованности, устойчивости в разных реальных условиях и более тесная интеграция восприятия с системами принятия решений и управления.
В дальнейшем RAMMP стремится создать ассистивные системы, которые смогут не только точно воспринимать окружающую среду, но и со временем адаптироваться к индивидуальным потребностям, поведению и контексту каждого пользователя.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram