i
ДАТАИСТ
Новости · 2026-08-30

AgentHands: интерактивные жесты рук в пространственно привязанных диалогах ИИ-агентов в XR

Google XR представила AgentHands — исследовательский прототип для XR, который добавляет разговорным ИИ-агентам синхронные выразительные жесты рук. Система связывает слова агента с объектами в физическом пространстве: может указать на корни орхидеи, показать поворот ручки 3D-принтера или предупредить о нездоровом выборе. Работа опубликована на CHI 2026; в исследовании с 12 участниками AgentHands сравнивали с голосовым интерфейсом без жестов.

Обложка: AgentHands: интерактивные жесты рук в пространственно привязанных диалогах ИИ-агентов в XR

Google показала AgentHands — жесты для ИИ-агентов в Android XR

По мере развития ИИ-помощников текстовые интерфейсы превращаются в мультимодальные системы, способные учитывать окружающую обстановку. Project Astra и Gemini 3.1 Flash Live уже позволяют обсуждать физическое пространство в реальном времени, часто используя рамки вокруг объектов на изображении с камеры. Для плоских экранов это удобно, но в иммерсивных платформах вроде Android XR возникает другая задача: как превратить такой диалог в пространственное взаимодействие, а не просто наложить элементы интерфейса на изображение.

AgentHands, созданный Xun Qian, научным сотрудником, и Ruofei Du, руководителем направления интерактивного восприятия и графики в Google XR, переносит жесты, сопровождающие речь, в трёхмерный мир. В обычном разговоре человек не только показывает направление рукой, но и описывает форму, изображает действие и выделяет важные моменты. Прототип использует пространственное понимание XR, чтобы связать эти движения с речью и окружением пользователя. Он продолжает предыдущие исследования Human I/O и Sensible Agent, добавляя ИИ-агентам выразительные жесты, которые превращают словесные инструкции в физические демонстрации.

Источник: research.google

Сначала авторы провели подготовительное исследование с экспертами Google по XR и взаимодействию человека с компьютером. Они выясняли, какие свойства делают виртуальную руку понятной в трёхмерной среде. Результаты оформили в многомерную таксономию: она описывает, как агенту использовать руки, чтобы привязывать разговор к физическому пространству пользователя.

Таксономия AgentHands включает шесть измерений: ведущую руку, тип жеста, пространственные характеристики, временную динамику, интерактивность и визуальные эффекты.

Схема рабочего процесса системы AgentHands, генерирующей аннотированный текст, события жестов и речь с временными метками на основе вопроса пользователя и направления его взгляда

Источник: research.google

Источник: research.google

Что такое AgentHands

Основная идея AgentHands — перевод рассуждений большой языковой модели в точные движения рук, синхронизированные с голосом агента и обстановкой пользователя. Для этого система выполняет несколько последовательных действий.

Сначала лёгкий модуль регистрации объектов использует взгляд пользователя и реконструкцию сцены. Пользователь может быстро отметить предмет — например, орхидею или ноутбук, — после чего система создаёт пространственный реестр с трёхмерными рамками объектов. Агент получает возможность ссылаться на них во время разговора.

Таксономия виртуальных жестов: используемая рука, жест, пространственные характеристики, временная динамика, интерактивность и визуальные эффекты

Источник: research.google

Затем авторы собрали библиотеку жестов, разделив их на три смысловые категории:

указательныеиконическиеэмоциональные

Указательные жесты нужны для обращения к конкретным объектам, иконические изображают действия или формы, а эмоциональные передают социальные сигналы и настроение.

Схема рабочего процесса, показывающая обработку направления взгляда, сетки сцены и вида от первого лица для создания трёхмерного ограничивающего параллелепипеда вокруг орхидеи

Источник: research.google

Когда пользователь задаёт вопрос, серверная языковая модель формирует ответ со встроенными событиями жестов. Каждое событие связано с определёнными словами-сигналами и содержит параметры движения, заданные измерениями таксономии.

Локальный анализатор на XR-гарнитуре синхронизирует озвучивание текста с движением рук. Для этого система использует временные метки на уровне отдельных слов: руки начинают движение одновременно с нужными фрагментами речи, а жесты указывают на объекты в пространстве.

Так стандартный ответ языковой модели превращается в мультимодальное представление: агент одновременно говорит и выполняет пространственно точные движения. Благодаря этому сложные инструкции можно показывать прямо в тех местах физической среды, к которым они относятся.

Диаграмма, разделяющая жестовое поведение на три категории: дейктические (указание), иконические (представление форм и размеров) и экспрессивные (эмоции)

Источник: research.google

Источник: research.google

Где применяют жесты

Авторы показали, как пространственные жесты помогают ориентироваться в окружающей обстановке.

В сценарии ухода за орхидеей агент не ограничивается советом проверить корни. Он подводит руки к основанию растения, обводит воздушные корни и объясняет их функцию.

Фотографии, расположенные рядом, демонстрирующие условия пользовательского исследования с плавающими синими аватарами рук рядом с орхидеей (a) и 3D-принтером (b)

Источник: research.google

Для работы с 3D-принтером агент может показать точную последовательность действий — повернуть ручку и нажать на неё, чтобы открыть нужный пункт меню и выбрать файл. Такие шаги становятся понятнее при работе со сложным физическим интерфейсом.

В сценарии сопровождения повседневных привычек агент выступает в роли тренера по здоровому образу жизни. Например, он может удержать руку пользователя, выполнить интерактивный предупреждающий жест и добавить визуальный эффект, чтобы предостеречь от нездорового действия.

Источник: research.google

Пользовательское исследование

Чтобы оценить эффект жестов, исследователи провели внутригрупповое исследование с 12 участниками. AgentHands сравнивали с базовой версией, которая использовала только речь. В обоих случаях звучал один и тот же заранее подготовленный исследователями текст, поэтому различие заключалось только в наличии рук и синхронных жестов.

Участники выполняли две процедурные задачи: уход за растением и техническую операцию с 3D-принтером.

Столбчатая диаграмма, сравнивающая оценки удобства использования AgentHands и базового метода по десяти метрикам диалога по семибалльной шкале

Источник: research.google

Результаты показали, что сочетание XR и жестов, сопровождающих речь, улучшает пространственное взаимодействие. Исследователи анализировали несколько показателей эффективности коммуникации. По данным опросника восприятия функций системы, AgentHands заметно опередил голосовую базовую версию по пониманию местоположения объектов, пониманию действий и заметности предупреждений.

Google рассматривает AgentHands как шаг к системам, которые не только анализируют окружающий мир, но и действуют в нём через движения. Жесты, синхронизированные с речью, помогают связать разговор с физическими объектами, снизить когнитивную нагрузку при сложных задачах и сделать пространственные вычисления доступнее.

Для экосистемы Android XR команда также изучает персонализацию жестов: агент сможет учитывать ведущую руку пользователя и запоминать характерные пространственные привычки.

Основную часть исследования провёл Ziyi Liu во время работы в Google в статусе студента-исследователя. Проект стал совместной работой нескольких команд. Авторы отдельно поблагодарили David Li, Zhongyi Zhou и David Kim за вклад, а Adarsh Kowdle, Guru Somadder и Shahram Izadi — за рекомендации и рецензирование.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram