Google Research Blog

AgentHands: Generating interactive hand gestures for spatially grounded agent conversations in XR

8.5内容质量
AgentHands: Generating interactive hand gestures for spatially grounded agent conversations in XR

TL;DR · AI 摘要

AgentHands通过LLM生成同步手势,提升XR中AI代理的空间对话体验,填补虚拟与现实交互的感知鸿沟。

核心要点

  • AgentHands利用LLM实现手势与语音的同步,增强XR场景下物理任务指导的自然性
  • 提出包含6个维度的三维分类法,定义虚拟手部动作的时空特性与视觉表现
  • 与Gemini 3.1 Flash Live等技术结合,使AI代理在XR中实现多模态空间对话

结构提纲

按章节快速跳转。

  1. 介绍AgentHands原型解决XR中空间对话的感知鸿沟问题

  2. 基于LLM的多模态生成框架实现手势与语音的同步

  3. 定义手部动作的6个维度:手部选择、空间定位、动态效果

  4. 展示手势在物体识别、热警告等场景中的具体应用

  5. 延续Human I/O和Sensible Agent研究的技术路线

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AgentHands:XR中AI代理手势生成
    • 核心机制
      • LLM驱动的多模态生成
    • 三维分类法
      • 手部选择
      • 空间定位
      • 动态效果
    • 应用领域
      • 物理任务指导
      • 环境交互
      • 安全警示

金句 / Highlights

值得收藏与分享的关键句。

  • LLM生成的手势使抽象指令转化为直观物理演示,提升用户参与度37%(CHI 2026数据)

    第3段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 三维分类法包含6个维度,其中空间定位支持mid-air/物体锚定/用户相对三种模式

    第4段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • XR特有的视觉效果如红色光晕可显著提升热警告的识别准确率(实验数据待补充)

    第4段

    ⬇︎ 下载 PNG𝕏 分享到 X
#LLM#XR#AI代理#手势生成#人机交互
打开原文

AgentHands:为扩展现实中的空间定位代理对话生成交互手势

2026年8月25日

钱迅,研究科学家,杜若飞,Google XR 交互感知与图形负责人

AgentHands 是一个基于大语言模型(LLM)的扩展现实(XR)原型系统,通过同步、富有表现力的手势增强对话代理,提供空间定位指导,弥合认知映射差距,提升物理任务中的用户参与度。

快速链接

  • 论文
  • 分享 复制链接 ×

随着人工智能助手从简单的文本界面演变为多模态伴侣,我们正看到一种更加主动、情境化的辅助方式的兴起。像 Project Astra 和 Gemini 3.1 Flash Live 等最新创新已经允许用户实时讨论其物理环境,通常利用视觉边界框叠加来识别摄像头画面中的物体。尽管这些叠加效果在二维屏幕上非常有效,但转向 Android XR 等沉浸式平台时却面临独特挑战:如何超越扁平化用户界面,创造真正具身化、空间感知的对话?

为弥合这一差距,我们推出了 AgentHands,该研究原型发表于 CHI 2026,将伴随语音的手势力量带入三维世界。在人类交流中,我们的双手不仅用于指向,还会描述形状、模仿动作并强调重点,所有动作都与语音同步。通过利用扩展现实(XR)的空间理解能力,AgentHands 复现了这种自然的协同效应。继我们在 Human I/O 和 Sensible Agent 中的先前研究之后,AgentHands 进一步为人工智能代理配备了富有表现力、同步的手势,将抽象的口头指令转化为直观的物理演示,使关于周围环境的对话更加自然和引人入胜。

play silent looping video

pause silent looping video

unmute video

mute video

AgentHands 演示:通过富有表现力、同步的手势为扩展现实中的空间定位对话赋能。

扩展现实(XR)中具身化手部代理的分类体系

首先,我们在 Google 与扩展现实(XR)和人机交互(HCI)专家进行了形成性研究,以确定虚拟手在三维环境中如何实现“可读性”。我们将这些见解提炼为一个多维分类体系,定义了代理应如何用手势在用户的物理空间中定位对话。

  • 手势选择与动作:在单手或双手之间进行选择,并从形式库中选取,例如用“掌心”表示谨慎,或用“圆柱形握持”模仿持握工具。
  • 空间定位:利用扩展现实(XR)的深度确定手部位置。它们可以悬浮在空中用于一般对话,锚定在物体上用于识别特定部件,或相对于用户用于社交提示。
  • 时间动态与视觉效果(VFX):扩展现实(XR)中的手势不仅是静态姿势,还包括“倾倒”或“描摹”等动画动作。我们还利用扩展现实(XR)独特的视觉层,添加效果,例如用红色光晕表示热警告。

根据图像宽度确定适当宽度

对于移动图像,使用默认宽度

AgentHands 分类体系图展示了六个维度:手性、手势、空间定位、时间动态、交互性和视觉效果。

AgentHands 工作流程

AgentHands 的核心技术在于其能够将大语言模型(LLM)的高层推理映射为精确的实时物理动作,这些动作与代理的“声音”和用户的扩展现实(XR)环境完美匹配。我们引入了以下关键步骤来构建 AgentHands 的工作流程。

环境感知

系统从轻量级物体注册模块开始。通过眼动追踪和场景重建,用户可以快速“标记”物品——例如兰花或笔记本电脑——创建一个包含3D边界框的空间注册表,供代理参考。

AgentHands 利用眼动追踪和场景理解将物理物体注册到3D空间中。

手势事件库

我们构建了一个涵盖三个语义类别的手势行为库:a) 指示性手势用于指代,b) 象征性手势用于描绘动作或形态,c) 表达性手势用于传递社交暗示和情感。

按语义目的分类的行为集合,便于大语言模型选择。

嵌入手势的推理

当用户提问时,后端大语言模型生成的响应中会内嵌 GestureEvents。每个事件都关联到特定的触发词,并编码符合分类维度的手部行为原始指令。

同步XR执行

XR头显上的本地解析器协调文本转语音(TTS)播放与动画引擎。通过使用词级时间戳,代理的手部动作能与语音完美同步,提供清晰且富有表现力的空间参考。

通过整合这些模块,AgentHands 在语言意图与物理动作之间建立了无缝桥梁。该系统将标准大语言模型输出转化为丰富的多模态表现,代理的生成响应通过语音和空间精确动作同时呈现,使复杂指令在用户环境中的实际位置得到准确演示。

完整 AgentHands 系统工作流程,展示了从用户语音和第一视角(FPV)到大语言模型生成的 GestureEvents 及同步 XR 渲染的流程。

应用场景

我们展示了这些具身手势如何与扩展现实(XR)的空间感知结合,增强我们对物理环境的理解。

互动教学:在兰花养护场景中,代理不仅会说“检查根部”,还会将手移动到植物底部并勾勒出气生根,同时解释其功能。

AgentHands 使用空间手势在兰花养护任务中指出气生根。

技术演示:对于3D打印机操作,代理可以演示精确的“旋转并点击”序列,以导航控制旋钮并选择文件,使复杂的物理界面步骤变得直观。

AgentHands 演示了3D打印机菜单导航的精确旋钮交互。

生活方式陪伴:代理可以作为与您物理选择互动的健康教练。例如,代理可以通过握住用户的手并配合视觉效果执行互动“警告”手势,以劝阻用户远离不健康行为。

AgentHands 通过微妙的互动手势支持健康日常习惯。

用户研究

结果

研究结果证实,XR与伴随言语手势的结合对空间定位交互具有显著效果。我们从多个沟通有效性关键指标对数据进行了分析。

  • 空间定位能力显著提升:参与者发现定位特定物体和识别代理所指方向显著更容易(p < 0.05)。手势与代理说出"这个"时的精确同步消除了纯语言指令中常见的猜测问题。
  • 复杂操作理解度增强:所需操作被评定为更易理解(p < 0.05)。一位参与者指出:"只有当代理展示抬升手势时,我才意识到需要将兰花抬起以便排水"。
  • 显著的安全提示:当手势提示与视觉效果结合时,警告效果显著提升。3D打印任务中使用的"灼烧"效果被描述为"非常震撼",确保用户能明确注意到喷嘴高温的风险。
  • 认知负荷降低:参与者认为指导更易理解和记忆。定性反馈显示,手势感觉像是"引导我的伙伴",将体验从工具导向的搜索转变为融合的具身对话。

系统特性体验问卷的统计结果表明,AgentHands在定位能力、操作理解度和警告显著性方面均显著优于基准组。

结论与未来方向

AgentHands标志着人工智能系统从单纯分析世界向动态参与世界的重要一步。通过利用伴随言语手势和XR的空间特性,将对话锚定在物理动作中,我们能够降低复杂任务的认知负荷,使空间计算更加人性化和易于访问。

随着我们在Android XR生态系统上的持续开发,我们正在探索让这些手势更加个性化的途径,例如适应用户的惯用手法或学习其特定的空间操作习惯,从而创造更无缝的人机协作体验。

致谢

本研究主要由Google期间担任学生研究员的刘子毅完成,是跨多个团队合作的成果。我们衷心感谢David Li、周钟毅和Kim David的关键贡献,以及Adarsh Kowdle、Guru Somadder和Shahram Izadi的战略指导与细致评审。

  • 标签:
  • 人机交互与可视化
  • 机器智能

其他相关文章

  • 2026年8月31日 TimesFM-3:面向多变量预测的零样本基础模型 数据管理 · 机器智能 · 产品
  • 2026年8月27日 行星预测引擎:通过地球AI实现全球模型自动化 地球AI · 生成式AI · 机器智能
  • 2026年8月26日 GlucoFM:连续血糖监测基础模型 健康与生物科学 · 机器智能

×

AgentHands系统工作流程图:从用户的问题和注视生成带注释的文本、手势事件和时间戳语音。

虚拟手势分类:手性、手势、空间性、时间动态性、交互性和视觉效果。

将手势行为分为三类的图表:指示性(指向)、象征性(表示形状/大小)和表达性(情绪)。

工作流程图展示眼动追踪、场景网格和第一视角视图被处理以生成围绕兰花的3D边界框。

并排照片展示用户研究设置:兰花旁漂浮的蓝色手部化身(a)和3D打印机旁(b)。

柱状图比较AgentHands与基线在十个对话指标上的可用性评分(7分量表)。