Google показала AgentHands — жесты для ИИ-агентов в Android XR
Исследователи Google Xun Qian и Ruofei Du представили AgentHands — исследовательский прототип для XR, который добавляет разговорным ИИ-агентам синхронизированные жесты рук. Система связывает слова агента с объектами и действиями в физическом пространстве: может указать на воздушные корни орхидеи, показать последовательность действий с 3D-принтером или жестом предупредить о вредной привычке. В исследовании с 12 участниками AgentHands сравнили с версией только с голосом и проверили на задачах по уходу за растением и работе с 3D-принтером.
Жесты в пространстве
По мере развития ИИ-помощников они переходят от текстовых интерфейсов к мультимодальному взаимодействию с окружающим миром. Project Astra и Gemini 3.1 Flash Live уже позволяют обсуждать физическое окружение в реальном времени, например выделяя объекты рамками на изображении с камеры.
Для плоского экрана такой подход подходит, но в иммерсивных платформах вроде Android XR возникает другая задача: разговор должен быть связан не только с изображением, но и с объектами в трёхмерном пространстве.
AgentHands, представленная на конференции CHI 2026, переносит жесты, сопровождающие речь, в 3D-среду. В обычном общении руки не только указывают на предметы: они описывают форму, повторяют действия и выделяют важные моменты. Используя способность XR понимать пространство, система воспроизводит эту связь между речью и движением.
AgentHands продолжает предыдущие исследования Human I/O и Sensible Agent. Прототип добавляет ИИ-агентам выразительные жесты, синхронизированные с речью, и превращает абстрактные словесные инструкции в физические демонстрации.
Источник: research.google
Источник: research.google
Что такое AgentHands
Сначала авторы провели формирующее исследование с экспертами Google в области XR и взаимодействия человека с компьютером. Они выясняли, какие свойства делают виртуальную руку понятной в 3D-среде.
На основе этого команда создала многомерную таксономию жестов. Она описывает, как агент должен использовать руки, чтобы связывать разговор с физическим пространством пользователя.
В неё входят шесть измерений:
Таксономия виртуальных жестов: используемая рука, жест, пространственные характеристики, временная динамика, интерактивность и визуальные эффекты
Источник: research.google
Ключевая функция AgentHands — переводить рассуждение LLM в точные движения, которые одновременно соответствуют голосу агента и окружению пользователя в XR.
Система начинается с лёгкого модуля регистрации объектов. С помощью взгляда пользователя и реконструкции сцены можно быстро отметить предмет — например, орхидею или ноутбук. После этого объект попадает в пространственный регистр с 3D-ограничивающей рамкой, на которую агент может ссылаться.
Схема рабочего процесса, показывающая обработку направления взгляда, сетки сцены и вида от первого лица для создания трёхмерной ограничивающей рамки вокруг орхидеи
Источник: research.google
Затем авторы собрали библиотеку жестовых сценариев, разделённых на три смысловые категории:
Схема, разделяющая жестовое поведение на три категории: дейктические (указательные), иконические (изображающие формы и размеры) и экспрессивные (эмоции)
Источник: research.google
Когда пользователь задаёт вопрос, серверная LLM формирует ответ со встроенными событиями жестов. Каждое событие привязано к определённым словам-триггерам и содержит параметры жеста, описанные через измерения таксономии.
Локальный анализатор на XR-гарнитуре связывает озвучивание текста с движком анимации. Система использует временные метки для отдельных слов, поэтому руки агента двигаются синхронно с произносимыми фразами и указывают на нужные места в пространстве.
Вместе эти модули связывают языковое намерение с физическим действием. Обычный ответ LLM превращается в мультимодальную сцену: агент одновременно говорит и выполняет пространственно точные движения, показывая сложные инструкции непосредственно в окружении пользователя.
Схема рабочего процесса системы AgentHands, генерирующей аннотированный текст, события жестов и речь с временными метками на основе вопроса пользователя и направления его взгляда
Источник: research.google
Где применяются жесты
Авторы показали, как жесты, связанные с речью, и пространственное понимание XR помогают ориентироваться в физическом окружении.
В сценарии ухода за орхидеей агент не ограничивается советом проверить корни. Он подводит руки к основанию растения и обводит воздушные корни, объясняя их функцию.
Фотографии, расположенные рядом, демонстрирующие экспериментальные установки пользовательского исследования с парящими синими аватарами рук рядом с орхидеей (a) и 3D-принтером (b)
Источник: research.google
При работе с 3D-принтером агент может показать точную последовательность «повернуть и нажать», необходимую для управления ручками и выбора файлов в меню. Это помогает понять действия с физическим интерфейсом.
В сценарии повседневного сопровождения агент выступает в роли консультанта по здоровому образу жизни и реагирует на выбор пользователя. Например, он может удержать руку пользователя и добавить визуальный эффект, чтобы предупредить о вредной привычке.
Источник: research.google
Исследование с пользователями
Чтобы оценить влияние жестов, команда провела исследование с 12 участниками. AgentHands сравнили с базовой версией, которая использовала только речь. В обоих вариантах был один и тот же заранее подготовленный исследователями словесный сценарий, поэтому единственным различием оставались виртуальные руки и синхронизированные жесты.
Участники выполнили две процедурные задачи: одну, связанную с повседневным уходом, и вторую — с технической операцией.
Исследование проходило на двух площадках: станции ухода за орхидеей и станции управления 3D-принтером.
Столбчатая диаграмма, сравнивающая оценки удобства использования AgentHands и базовой системы по десяти разговорным метрикам по 7-балльной шкале
Источник: research.google
Результаты показали, что сочетание XR и жестов, сопровождающих речь, улучшает взаимодействие с объектами в пространстве. Авторы проанализировали несколько показателей эффективности коммуникации.
По результатам опросника восприятия функций системы AgentHands заметно опередила базовую версию по трём параметрам: пониманию местоположения, пониманию действий и заметности предупреждений.
Вывод
AgentHands показывает подход, при котором ИИ-система не только анализирует окружающий мир, но и действует в нём с помощью пространственно привязанных движений. Жесты, синхронизированные с речью, могут снизить когнитивную нагрузку при выполнении сложных задач и сделать пространственные вычисления понятнее.
В рамках развития экосистемы Android XR авторы изучают персонализацию жестов: адаптацию под ведущую руку пользователя и обучение его индивидуальным пространственным привычкам.
Основную часть исследования выполнил Ziyi Liu во время работы в Google в качестве студенческого исследователя. Проект стал совместной работой нескольких команд. Авторы также поблагодарили David Li, Zhongyi Zhou и David Kim за поддержку, а Adarsh Kowdle, Guru Somadder и Shahram Izadi — за рекомендации и рецензирование.
Источник: research.google
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram