人类如何自然地指向目标:理解人机交互中的多模态指令模式

人-机器人协作(HRC)远程操控与遥呈现(Telepresence)物理-数字混合交互医生、护士、临床医生HCI 研究员

文献标题

How Humans Naturally Refer to Targets: Understanding Multimodal Instruction Patterns in Human–Robot Interaction

出版信息

  • 主题领域: 人机交互(HRI)中的多模态通信与意图识别
  • 关键词: 多模态交互、人机交互、目标指代、视线追踪、指向手势、语音模式、意图识别、虚拟现实、用户行为、界面设计

背景与问题

  • 问题/挑战: 当前的多模态指令识别算法过于僵化且不完整,无法在非受限环境中充分利用人类自然的交流线索,如视线、手势和语音。
  • 重要性: 对自然多模态指令的稳健解读对于使机器人能够在动态环境中执行复杂任务至关重要,这将提升可用性和交互效率。
  • 动机与相关研究: 先前的研究主要集中在脚本化的多模态方案或仅语音系统上,这限制了适应性,未能捕捉用户的自发行为。本文通过研究自然多模态行为及其对意图识别的影响来填补这一空白。

解决方案

  • 提出的方法: 基于虚拟现实(VR)的研究,分析人机交互中目标指代任务期间的自然多模态行为(语音、视线、手势、头部运动)。
  • 创新点:
    1. 系统性分析自然、非受限环境下的语言和非语言行为。
    2. 评估各种多模态线索的空间精度,揭示一致性和上下文相关的模式。
    3. 为以视线为中心的意图识别算法和具备前馈与反馈机制的交互系统提供设计启示。
  • 研究流程与关键技术:
    1. 进行一项VR实验,30名参与者完成家庭任务(如拾取与放置、清洁)。
    2. 操控空间(距离、方向)和上下文(指代复杂性)变量。
    3. 收集多模态数据(语音、视线、手部动作、头部方向),并使用统计模型分析模式。
    4. 使用多种计算方法比较不同多模态向量(如视线、手部指向)的定位精度。

结果

  • 具体发现:
    • 21.7%的语音指令缺乏目标属性,使用了诸如“这个物体”之类的模糊表达。
    • 视线向量在定位精度上表现最佳(使用最小距离法的中位误差为0.006 m),至少比其他向量高出一个数量级。
    • 参与者根据距离和目标复杂性动态调整语音和多模态行为(如对远距离或复杂场景使用更多描述性特征)。
    • 识别出四种多模态协调模式,其中手眼协调和目标锁定注意最为常见。
  • 相较基线的优势:
    • 基于峰值区间的方法将视线-目标误差降低至0.08 m,而语音窗口平均法的误差为0.48 m。
    • 以视线为中心的多模态融合通过利用基于行为的启发式方法,优于传统的端到端方法。
  • 实验/评估:
    • 在模拟家庭任务的VR环境中收集了2,430条指令。
    • 对多模态数据进行统计分析(如线性混合模型、G检验),评估行为和定位精度的空间与上下文效应。
  • 局限性与未来工作:
    • 由于基于VR的模拟,生态效度有限;未来研究应在真实环境中验证结果。
    • 基于规则的方法无法完全捕捉用户多样性;未来工作应开发结合生理与脑机接口信号的AI模型。
    • 未将环境噪声、机器人外观和交互性作为变量。

总结

本研究探讨了人机交互中自然多模态行为,重点分析用户如何通过语音、视线、手势和头部运动指代目标。结果表明,模糊语音表达占主导地位,而视线在精确目标定位中起关键作用,视线向量的精度最高。视线与其他模态(如手部指向)的时间协调可进一步增强意图识别。这些发现为以视线为中心的多模态算法和用户友好型界面的设计提供了启示,推动了HRI领域的理论理解和实际应用的发展。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222361/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790946
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
人-机器人协作(HRC)、远程操控与遥呈现(Telepresence)、物理-数字混合交互
work
职业/产业
医生、护士、临床医生、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文