Роботы учатся чувствовать как люди
За последние несколько лет модели «зрение—язык—действие» (VLA) заметно улучшили способность роботов выполнять сложные задачи с незнакомыми объектами и окружением. Сначала такие модели обучают на огромных массивах изображений, видео и текста, а затем проводят файн-тюнинг на меньшем числе демонстраций, записанных с телеуправлением робота. Благодаря этому роботы могут выполнять всё больше бытовых действий — складывать бельё, наводить порядок в гостиной и даже пользоваться кухонными приборами, опираясь только на видео и инструкции на естественном языке.
Но задачи, где нужны точные движения кисти, по-прежнему даются им трудно. Это касается работы с деформируемыми материалами и небольшими предметами — например, подключения USB-кабеля или поворота ключа в замке. Одна из причин в том, что VLA не используют один из главных источников информации, на который опираются люди в таких ситуациях: тактильную обратную связь.
Управление объектами по-человечески
Большинство точных манипуляций человек способен выполнять с закрытыми глазами, считает Тревор Даррелл, профессор информатики Калифорнийского университета в Беркли. Традиционные камеры плохо помогают оценивать силу, проскальзывание и точность захвата.
При этом научить робота работать с тактильными датчиками непросто. Их данные сильно отличаются от изображений, на которых обычно обучают VLA, а тактильных наборов данных гораздо меньше, чем интернет-масштабных коллекций изображений и текстов.
Команда Даррелла сначала обучила модель на уже существующих наборах данных, а затем добавила ей тактильное восприятие с помощью специализированной подмодели. Для этого исследователи собрали 100 часов качественных тактильных данных с демонстрациями обычных действий:
В записи вошли действия более чем с 200 разными бытовыми предметами. Эти данные легли в основу набора T-Rex; авторы также предлагают интерактивный просмотр его небольшой части.
Использовать тактильные данные напрямую оказалось сложно. Робот должен в реальном времени корректировать захват, ориентируясь на сигнал датчика. Для этого нужны более быстрые реакции, чем обычно обеспечивают модели «зрение—язык». По словам Даррелла, из-за такого несоответствия команда разделила управление между двумя подмоделями, или «экспертами».
Эксперт действий строит планы движений. Тактильный эксперт работает в четыре раза быстрее и меняет этот план в реальном времени — в зависимости от того, что робот ощущает во время манипуляции.
Затем модель дообучили примерно на 100 демонстрациях, записанных с телеуправлением. В них были сравнительно сложные задачи:
В 12 задачах средняя успешность составила 65% — почти вдвое больше, чем у лучшей VLA-модели.
Разнообразие данных
Даррелл признаёт, что его данные собраны только на одном варианте роботизированного оборудования. Роботизированные кисти бывают разными: от полностью подвижных пяти пальцев до простых захватов-клещей. Тактильные датчики тоже используют разные физические принципы: одни измеряют изменения сопротивления, другие фиксируют деформацию мягкой гелевой подложки на изображении.
По словам Чэнбо Юаня, магистранта Университета Цинхуа в Пекине, поэтому большинство исследований в области тактильного ИИ привязано к конкретному типу датчика. Из-за этого группам трудно обмениваться данными и переносить результаты обучения.
Юань решил устранить эту проблему, объединив более 3 000 часов тактильных данных из общедоступных наборов. Они охватывают 21 тип датчиков и разные варианты роботов. Исследователей вдохновили проекты вроде сотрудничества Open X-Embodiment: в нём собрали данные от множества роботов и создали модели, способные обобщать знания на оборудование, которого не было в обучающей выборке.
Команда Юаня разработала модель, не зависящую от конкретного оборудования. Она приводит выходные данные разных датчиков к общему формату и отображает их на обозначенные позиции шаблона человеческой руки. Такая модель заметно превзошла базовую даже на оборудовании, с которым раньше не сталкивалась. Юань связывает это с тем, что обучение на столь разных конфигурациях позволило модели приобрести «некое общее чувство тактильных знаний».
Масштабирование данных
Несмотря на эти результаты, Юань считает, что тактильных данных нужно больше. Его группа возглавляет сотрудничество 80 организаций, которые собирают более крупный набор демонстраций с телеуправлением. Для этого используют единый подход к записи и обработке тактильных данных.
Тем временем Фуданьский университет в Шанхае и выделившаяся из него компания NeoteAI уже создали набор данных, который на порядок превосходит предыдущие проекты по масштабу. Исследователи использовали собственный датчик, установленный на разных роботизированных руках, а также ручной захват, которым управляли люди. В результате они собрали более 30 000 часов демонстраций с синхронными визуальными и тактильными данными.
На этих данных исследователи обучили модель, которая не только реагирует на прикосновения, но и заранее предсказывает, что робот должен почувствовать. Это помогает направлять действия и оценивать их результат. Шуньлинь Лу, исследователь Фуданьского университета и технический директор NeoteAI, считает, что результаты показывают прямую связь между доступом к крупным разнообразным тактильным данным и ростом эффективности.
Другой способ увеличить объём тактильных данных — использовать уже накопленные визуальные записи о работе роботов. Исследователи Университета Южной Калифорнии в Лос-Анджелесе недавно представили модель, которая учится выводить тактильную информацию из изображения.
Для обучения они использовали более 2 700 демонстраций бытовых манипуляций. В них применялся ручной захват, одновременно записывавший тактильные данные и изображения с установленной на нём камеры. Модель научилась связывать момент, когда захват касается предмета, с давлением, которое фиксируют тактильные датчики. Благодаря этому даже роботы без тактильных датчиков получили элементарное чувство прикосновения. Исследователи показали, что оно особенно полезно в задачах с большим количеством контактов.
Более широкая цель этой работы — использовать генератор для добавления тактильных данных в существующие визуальные наборы.
Пока неизвестно, сколько тактильных данных потребуется для прорыва в задачах точного управления. По словам Юаня, главный результат тактильного обучения пока заключается в том, что роботы быстрее осваивают уже доступные им действия, например захват и перемещение объектов. Он предполагает, что для задач, принципиально невозможных без осязания, могут потребоваться новые алгоритмы.
Лун Чэн из Китайской академии наук также считает, что одних исходных данных недостаточно. Зрение даёт непрерывный поток изображений с большим объёмом информации, а тактильные сигналы появляются редко и прерывисто. Поэтому модели учатся их игнорировать.
Решение, которое Чэн представит на IROS 2026 позже в этом месяце, строится на сравнении ожидаемых и реальных ощущений робота. Сначала модель по одному зрению предсказывает, что робот должен почувствовать, а затем сопоставляет прогноз с настоящим тактильным сигналом. Если разница велика, значит, датчик обнаружил то, что робот иначе пропустил бы. Такие неожиданные сигналы усиливаются, а предсказуемые ослабляются.
В пяти задачах с большим количеством контактов этот подход достиг средней успешности 62,8%, тогда как та же модель без тактильных данных показала 28,2%.
Лу увереннее оценивает перспективы масштабирования тактильных данных и сравнивает их с результатами в языковых и визуальных задачах. По его предположению, около 100 000 часов записей, собранных в разнообразных реальных условиях, а не только в лаборатории, могут открыть роботам новые способности.
Пока исследования дают первые признаки того, что крупные тактильные наборы и более продуманные способы их использования способны заметно улучшить работу роботов в одних из самых сложных задач. Лу считает тактильный интеллект следующим этапом развития физического ИИ.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram