Meta помогает Питтсбургскому университету развивать роботов для людей с инвалидностью
В США инвалидными креслами пользуются около 5,5 млн человек. Сохранение мобильности напрямую влияет на возможность работать, учиться и участвовать в повседневной жизни. Если вспомогательная техника плохо справляется со сложностями реального мира, это снижает самостоятельность пользователя и создаёт угрозу безопасности. Ежегодно в отделениях неотложной помощи США лечат более 100 000 травм, связанных с инвалидными креслами, часто после спотыканий и падений.
Что такое RAMMP
Проект «Роботизированная вспомогательная платформа для мобильности и манипуляций, обеспечивающая независимость людей с инвалидностью» — RAMMP — призван устранить ограничения существующих роботизированных платформ для мобильности. Для этого команда объединяет современную робототехнику, новую операционную систему и технологию цифровых двойников.
Цифровой двойник создаёт виртуальную среду, где платформу можно безопасно и масштабно тестировать и дорабатывать. В систему также интегрируют ИИ, включая несколько открытых моделей компьютерного зрения Meta: DINO и Segment Anything Model, или SAM.
DINO — трансформер компьютерного зрения с самообучением. Он извлекает визуальные признаки из неразмеченных данных, поэтому подходит для ситуаций, где мало подготовленных наборов изображений. SAM предназначена для сегментации объектов: модель может найти и обвести практически любой объект на изображении или видео по короткому запросу. Такие возможности делают её полезной там, где требуется точно распознавать предметы.
Обе модели уже применялись в проектах от анализа медицинских изображений до наблюдения за дикой природой.
DINOv3 и SAM на устройствах
В повседневной среде реакция должна быть быстрой: на тротуар может внезапно выбежать ребёнок, на пути появиться бордюр или с поверхности упасть связка ключей. Поэтому RAMMP обрабатывает изображения с камер и данные датчиков непосредственно на устройстве. Такой подход позволяет роботизированной платформе реагировать без задержек и работать в самых разных условиях.
Запуск DINOv3 и SAM на компактном оборудовании с аккумулятором связан с инженерными ограничениями. Команде приходится учитывать время работы батареи, отвод тепла, нестабильное сетевое соединение, а также строгие требования к размерам и весу устройства.
При этом новая робототехника должна помогать человеку выполнять обычные бытовые действия. Пользователь сможет взаимодействовать с роботом более естественно, используя окружающую обстановку как контекст, вместо сложных интерфейсов. Сочетание естественного языка и изображения позволяет задавать вопросы о сцене вокруг пользователя и робота и отдавать более прямые команды. Например, чтобы попросить робота поднять чашку со стола, человеку не придётся постоянно переключаться между разными элементами управления и удерживать в памяти лишний контекст.
Эти возможности уже внедряют в первый прототип RAMMP. Инструменты на основе DINO позволяют запрашивать данные камер и находить кнопки автоматических дверей, чашки, бордюры и поверхность земли для навигации. Теперь, когда система готова к испытаниям в реальных условиях, инженеры сосредоточились на голосовом и сенсорном вводе. Пользователь сможет выбирать конкретные объекты вокруг себя и взаимодействовать с ними.
Команде также нужно обеспечить точность и временную согласованность результатов модели, а кроме того — предсказуемую работу при разных запросах и способах ввода.
DINOv3 выполняет роль компактного и экономичного «зрительного мозга» устройства. На его основе можно создавать лёгкие модули для конкретных задач — например, обнаружения объектов или отслеживания движения. Это позволяет повторно использовать визуальные данные и экономить заряд батареи.
При подготовке моделей к работе на периферийных устройствах инженеры уменьшают объём занимаемой памяти, при необходимости используют вычисления с пониженной точностью и выбирают форматы, подходящие для реальных условий. Практическое разрешение изображений и эффективная пакетная обработка помогают DINOv3 и SAM работать быстро и стабильно даже на компактных аккумуляторных платформах и роботизированных манипуляторах. Иногда ради скорости и предсказуемости приходится немного жертвовать точностью границ объектов или детализацией признаков.
По словам Sivashankar Sivakanthan, руководителя аппарата проекта RAMMP, эффективность вспомогательной робототехники определяется тем, насколько надёжно система работает в непредсказуемой повседневной среде, а не только результатом на бенчмарке. Запуск DINOv3 и SAM непосредственно на устройстве даёт восприятие в реальном времени, которому пользователь может доверять, без зависимости от подключения и с сохранением требований к безопасности.
Как обучают систему восприятия
Система восприятия RAMMP построена на лёгкой модели обнаружения RF-DETR, дообученной с использованием эмбеддингов DINOv2. Для подготовки обучающих данных команда применяет SAM: модель автоматически размечает изображения, что позволяет быстро создавать качественные аннотации для разных ракурсов, высот, фонов и условий освещения.
Дополнительные преобразования данных и стратегии с несколькими видами одного объекта помогают сохранять согласованность результатов при смене перспективы. В итоге система должна распознавать окружение и объекты в реальном времени, обеспечивая круговой обзор на 360 градусов и адаптивное обнаружение предметов.
Сочетание возможностей SAM по разметке данных и визуальных представлений DINOv2 используется внутри дообученной модели RF-DETR. Такой подход позволяет RAMMP одновременно получать данные об окружающей сцене и адаптироваться к объектам, которые встречаются пользователю.
Партнёры проекта
HERL и ATDev — ключевые партнёры консорциума RAMMP. HERL руководит инициативой, опираясь на опыт в биомедицинской инженерии и исследованиях с участием пользователей, а также формирует направление развития вспомогательной мобильности. ATDev отвечает за инженерную часть и превращает разработки HERL в устройства, пригодные для работы в реальном мире.
В проекте участвуют пользователи инвалидных кресел, врачи и правозащитные организации. Такой подход помогает учитывать реальные потребности людей, а не только предполагаемые сценарии использования.
В национальный консорциум также входят Kinova Robotics, LUCI Mobility, ATDev и исследователи из Carnegie Mellon, Cornell, Northeastern и Purdue.
По словам Mansoor Khan, руководителя программы ARPA-H, проект должен помочь американцам с ограниченной мобильностью жить более самостоятельно, работать и проводить свободное время. Модели зрения Meta дают роботизированной платформе возможность «видеть»: понимать сцену, ориентироваться в окружающем пространстве и выбирать нужные предметы. Это уменьшает когнитивную нагрузку на пользователя.
RAMMP также должен способствовать появлению новых рабочих мест и производственных возможностей в Питтсбурге и по всему штату Пенсильвания. Речь идёт о развитии вспомогательных мобильных решений и их производстве внутри страны.
Alicia Jackson, доктор философии, директор ARPA-H, заявила, что людям с ограниченной мобильностью нужны технологии, которые подстраиваются под их обстоятельства. По её словам, сотрудничество с Meta и использование передовых моделей ИИ в робототехнике для людей с инвалидностью позволит ускорить создание таких систем.
Дальнейшая работа
Команда RAMMP продолжит интеграцию моделей восприятия нового поколения, включая SAM 3.1 и DINOv3. Исследователи намерены улучшить понимание окружающей среды в реальном времени и взаимодействие с объектами.
В следующих этапах проекта внимание уделят временной согласованности, устойчивости к разным условиям реального мира, а также более тесной связи восприятия с системами принятия решений и управления. В перспективе RAMMP должна учитывать индивидуальные потребности, поведение и контекст каждого пользователя и со временем адаптироваться к ним.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram