Meta помогает Питтсбургскому университету развивать робототехнику для людей с инвалидностью
В Питтсбурге Лаборатория инженерии человека при Университете Питтсбурга (Human Engineering Research Laboratories, HERL) и компания ATDev создают роботизированную платформу RAMMP для самостоятельной мобильности и манипуляций людей с инвалидностью. Проект получил до $41,5 млн от американского агентства ARPA-H. В RAMMP объединяют робототехнику, ИИ, цифровых двойников и открытые модели зрения Meta — DINO и Segment Anything Model (SAM). Платформа должна распознавать окружающую обстановку, помогать с навигацией и взаимодействовать с предметами в реальном времени, в том числе на устройствах с ограниченными вычислительными ресурсами.
Зачем нужна RAMMP
В США около 5,5 млн человек пользуются инвалидными креслами. Сохранение мобильности напрямую влияет на возможность работать, учиться, заниматься повседневными делами и участвовать в жизни общества. Если вспомогательная техника плохо справляется со сложной реальной обстановкой, это снижает уверенность пользователя, его самостоятельность и безопасность.
Ежегодно в отделения неотложной помощи США обращаются более 100 000 человек с травмами, связанными с инвалидными креслами. Часто причиной становятся спотыкания и падения. Поэтому разработчикам нужны более умные, безопасные и адаптивные системы.
Проект RAMMP, который поддерживает ARPA-H, призван устранить ограничения существующих роботизированных платформ мобильности. В нём объединяют передовую робототехнику, новые операционные системы и технологию цифровых двойников. Она создаёт виртуальную среду, где системы можно безопасно и масштабируемо проверять и дорабатывать.
В проект также встроены модели ИИ, включая открытые модели зрения Meta — DINO и Segment Anything Model (SAM).
DINO — трансформер компьютерного зрения с самообучением. Он учится извлекать визуальные признаки из неразмеченных данных, поэтому подходит для ситуаций, где мало размеченных наборов данных. SAM предназначена для сегментации любых объектов: модель может найти и обвести практически любой предмет на изображении или видео, получив минимальный запрос. Благодаря универсальности и точности SAM используют в задачах, где требуется точно распознавать объекты.
DINOv3 и SAM на устройствах
Для людей, которые зависят от вспомогательных устройств, скорость реакции имеет значение. В повседневной среде ребёнок может внезапно выбежать на тротуар, перед креслом может появиться бордюр, а на полу — оказаться связка ключей. Такие ситуации требуют немедленной реакции.
Обработка изображений с камер и данных датчиков прямо на устройстве называется периферийными вычислениями. Она позволяет роботизированной платформе мобильности работать быстрее и стабильнее. При этом система должна сохранять надёжность в самых разных меняющихся условиях.
Запуск мощных моделей вроде DINOv3 и SAM на компактном оборудовании с аккумулятором связан с инженерными ограничениями. Разработчикам приходится учитывать продолжительность работы батареи, отвод тепла, нестабильное сетевое соединение, а также строгие требования к размеру и весу устройства.
Но для пользователя все эти технические решения имеют смысл только в том случае, если робот помогает выполнять повседневные дела. Новые методы позволяют взаимодействовать с системой естественнее: использовать окружающую обстановку как контекст и не создавать сложные интерфейсы для каждой операции.
Пользователь может с помощью естественного языка и изображения запросить информацию об окружении кресла или робота и отдать более прямую команду. Это снижает когнитивную нагрузку и количество переключений между контекстами — например, когда нужно просто взять чашку со стола.
Команда RAMMP уже внедряет такую функцию в первый прототип. Инструменты на базе DINO позволяют обращаться к изображениям с камер робота и находить кнопки автоматических дверей, чашки, бордюры и поверхность земли для навигации.
Функция готова к испытаниям в реальной среде. Сейчас инженеры сосредоточились на голосовом и сенсорном вводе, чтобы пользователь мог выбирать конкретные объекты вокруг себя и взаимодействовать с ними.
Помимо точности и временной согласованности результатов моделей, разработчикам нужно обеспечить устойчивость и предсказуемость системы при разных пользовательских запросах и способах ввода.
DINOv3 работает как компактный и экономичный «визуальный мозг» устройства. Это универсальная основа, поверх которой можно размещать лёгкие модули для отдельных задач — например, обнаружения объектов или отслеживания движения. Такой подход позволяет повторно использовать визуальные данные и экономить энергию.
При подготовке моделей к работе на периферийных устройствах инженеры уменьшают занимаемый объём памяти, при необходимости используют более низкую точность вычислений и выбирают форматы, подходящие для реальных условий. Благодаря этому система может работать в реальном времени.
Практические разрешения изображений и эффективная пакетная обработка помогают DINOv3 и SAM сохранять скорость и стабильность даже на компактном оборудовании с аккумулятором — в роботизированных платформах мобильности и роботизированных манипуляторах. Иногда разработчики жертвуют частью точности границ или детализацией признаков ради скорости и устойчивости, которые нужны пользователю в движении. Такой баланс между точностью и практичностью лежит в основе проекта.
По словам Sivashankar Sivakanthan, руководителя аппарата проекта RAMMP, эффективность вспомогательной робототехники нельзя оценивать только по точности на бенчмарках. Важнее, способна ли система надёжно работать в непредсказуемых повседневных условиях. Запуск DINOv3 и SAM прямо на устройстве обеспечивает восприятие в реальном времени без зависимости от подключения к сети и без снижения требований к безопасности.
Как обучают систему восприятия
Система восприятия RAMMP построена на лёгкой модели обнаружения RF-DETR, дообученной с использованием эмбеддингов DINOv2.
Данные для обучения автоматически размечают с помощью SAM. Это позволяет быстро создавать качественные аннотации для множества ситуаций, с которыми сталкиваются вспомогательные устройства в реальном мире: разных углов обзора, высоты камер, фона и освещения.
Дополнительные преобразования данных и стратегии с несколькими видами помогают сохранять согласованность результатов при смене перспективы. В итоге система должна обеспечивать адаптивное обнаружение объектов и более безопасное перемещение.
Сочетание возможностей SAM по разметке данных и визуальных представлений DINOv2 в дообученной модели RF-DETR даёт RAMMP круговой обзор окружающей обстановки на 360 градусов и адаптивное обнаружение объектов в реальном времени.
Кто участвует в проекте
HERL и ATDev — ключевые партнёры консорциума RAMMP. HERL руководит инициативой, опираясь на опыт в биомедицинской инженерии и исследованиях с участием пользователей, и формирует направление развития вспомогательной мобильности.
ATDev отвечает за инженерную часть и превращает исследования HERL в работающие устройства для реального мира. Вместе организации соединяют академические исследования и техническую разработку, ориентируясь на повседневный опыт пользователей.
HERL также привлекает к проектированию людей, которые пользуются инвалидными креслами, врачей и правозащитные организации. Такой подход с участием пользователей помогает учитывать реальные потребности, а не только предположительные сценарии.
В национальный консорциум RAMMP входят Kinova Robotics, LUCI Mobility, ATDev, а также исследователи из Carnegie Mellon, Cornell, Northeastern и Purdue.
По словам Mansoor Khan, руководителя программы ARPA-H, проект должен помочь американцам с ограниченной мобильностью легче жить самостоятельно, работать и проводить свободное время благодаря робототехнике. Он отметил, что модели зрения Meta позволяют роботизированной платформе видеть: понимать обстановку, ориентироваться в пространстве и выбирать нужные предметы. Это снижает нагрузку на пользователя и повышает его самостоятельность.
Экономический эффект
Помимо индивидуальной мобильности, RAMMP нацелен на развитие новых рабочих мест и производственных возможностей в Питтсбурге и по всей Пенсильвании. Проект должен поддержать разработку передовых решений для мобильности и их производство внутри страны, связав техническое развитие с экономическими и социальными задачами.
Alicia Jackson, Ph.D., директор ARPA-H, заявила, что люди с ограниченной мобильностью должны получать технологии, которые подстраиваются под их реальные условия, а не требуют от них приспосабливаться к устройству. По её словам, сотрудничество с Meta и внедрение передовых моделей ИИ в вспомогательную робототехнику должно ускорить создание таких систем.
Дальнейшая разработка
Команда RAMMP продолжит внедрять модели восприятия нового поколения, включая SAM 3.1 и DINOv3. Цель — улучшить понимание окружающей среды и взаимодействие с ней в реальном времени.
Дальнейшая работа будет сосредоточена на временной согласованности результатов, устойчивости в разных реальных условиях и более тесной интеграции восприятия с системами принятия решений и управления.
В перспективе RAMMP хочет создать вспомогательные системы, которые смогут не только точно воспринимать окружающую обстановку, но и со временем адаптироваться к индивидуальным потребностям, поведению и контексту каждого пользователя.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram