
Google Research представила AgentHands — исследовательский прототип для платформы Android XR, который наделяет голосовых ИИ-агентов синхронизированными жестами рук. В отличие от плоских UI-оверлеев, привычных по Project Astra или Gemini 3.1 Flash Live, новая система переводит абстрактные инструкции в пространственно точные движения, привязанные к реальным объектам в комнате пользователя. Работа опубликована на конференции CHI 2026.
Ключевые факты
| Параметр | Значение |
|---|---|
| Разработчик | Google Research (Xun Qian, Ruofei Du) |
| Публикация | CHI 2026 |
| Платформа | Android XR |
| Основная инновация | LLM генерирует GestureEvents, синхронизированные с TTS по таймингу слов |
| Оценка | Внутригрупповое исследование (N=12), сравнение с речевым агентом |
Как устроен AgentHands
Исходная точка — формирующее исследование с экспертами по XR и человеко-машинному взаимодействию (HCI) в Google. Команда выделила шесть измерений «читаемости» виртуальной руки: handedness (какая рука), жест, пространственность, временная динамика, интерактивность и визуальные эффекты. На основе этой таксономии построена библиотека из трёх семантических категорий жестов — дейктические (указание), иконические (изображение формы или действия) и экспрессивные (социальные сигналы).
Рабочий процесс выглядит так. Пользователь в XR-гарнитуре «регистрирует» объекты взглядом — система строит 3D-ограничивающие рамки для каждого предмета (например, орхидеи или ноутбука). Когда пользователь задаёт вопрос, LLM генерирует текстовый ответ со встроенными GestureEvents. Каждое событие привязано к конкретным триггерным словам и кодирует параметры жеста по таксономии. Локальный парсер на гарнитуре синхронизирует анимацию рук с голосом на уровне отдельных слов.
Примеры сценариев
В демонстрации авторы показали три сценария. В сценарии ухода за орхидеей агент не просто говорит «проверьте корни» — он перемещает руку к основанию растения и обводит воздушные корни, объясняя их функцию. При настройке 3D-принтера агент показывает последовательность «поверни и нажми» на панели управления, делая интерфейс интуитивным. В режиме лайфстайл-компаньона агент использует предупреждающий жест — удерживает руку пользователя и накладывает визуальный эффект, чтобы остановить нежелательное поведение.
Результаты пользовательского исследования
Внутригрупповое исследование с 12 участниками сравнивало AgentHands с речевым агентом без жестов. Содержание речи в обеих группах было идентичным. Участники выполняли две задачи: уход за орхидеей и работа с 3D-принтером. По всем ключевым метрикам — понимание местоположения объекта, понимание действия и заметность предупреждений — AgentHands статистически значимо превзошёл речевой baseline.
Что это значит для разработчиков и пользователей
AgentHands — не коммерческий продукт, а исследовательский прототип. Однако он задаёт вектор для следующего поколения интерфейсов: от плоских подсказок на экране к пространственно осознанным агентам, которые не просто анализируют окружение, а физически взаимодействуют с ним. Для разработчиков это означает, что будущие SDK для Android XR могут включать API для генерации жестов, привязанных к LLM-выходу. Для пользователей — более естественный диалог с ассистентом, который показывает, а не только говорит.
Ограничения
Исследование проведено на малой выборке (12 человек) в контролируемых условиях. Все сценарии были заранее подготовлены исследователями, а не генерировались агентом в реальном времени. Авторы не раскрывают, какая именно LLM использовалась для генерации GestureEvents, и не приводят данных о задержках на реальном XR-устройстве. Прототип не оценивался в условиях шумной или динамически меняющейся среды.
Источник: Google Research Blog — AgentHands: Generating interactive hand gestures for spatially grounded agent conversations in XR (https://research.google/blog/agenthands-generating-interactive-hand-gestures-for-spatially-grounded-agent-conversations-in-xr/)