多模态人机交互中的目光与语音:范围综述

眼动追踪与注视交互语音用户界面(VUI)设计情感化人机对话HCI 研究员认知科学家UI/UX 设计师

文献标题

Gaze and Speech in Multimodal Human-Computer Interaction: A Scoping Review

出版信息

  • 主题领域: 多模态人机交互,重点研究注视与语音的集成。
  • 关键词: 多模态交互、注视输入、语音输入、人机交互、显式交互、隐式交互、时间对齐、融合策略、自适应系统、隐私。

背景与问题

  • 问题/挑战: 尽管已有数十年的研究,注视与语音在人机交互中的集成仍然是零散的,缺乏对重复模式、挑战和机遇的系统性总结。
  • 重要性: 注视和语音具有互补优势——注视提供空间定位,而语音传递语义信息——使其结合成为直观、自适应和免手操作交互的关键,尤其在如XR和AI眼镜等新兴技术中。
  • 动机与相关工作: 以往的综述通常广泛关注多模态交互,或分别研究注视或语音,而未分析两者的结合使用。本次综述通过系统性分析103篇研究,填补这一空白,揭示注视与语音结合的集成策略、任务领域及独特挑战。

解决方案

  • 提出的方法: 通过综述将注视与语音交互分为显式(有意控制信号)和隐式(行为线索)两种范式,分析其集成策略、特征表示及应用领域。
  • 创新性:
    1. 首次对注视与语音作为统一输入通道进行全面综合。
    2. 对多模态集成策略和特征表示进行详细分析。
    3. 绘制利用注视与语音的任务和领域图谱,突出设计挑战与机遇。
  • 流程与关键技术:
    • 在ACM-DL、IEEE Xplore、Scopus和Web of Science中使用精炼关键词进行结构化检索。
    • 筛选与纳入标准聚焦于单用户HCI中的注视与语音输入模式。
    • 按交互类型、集成策略和任务领域对研究进行编码。
    • 通过功能角色、融合策略和计算模型分析显式与隐式交互范式。

结果

  • 具体发现:
    • 显式交互(55篇研究):注视提供空间精度,语音传递命令或数据。常见组合包括“注视指向,语音作为命令”和“注视指向+确认,语音作为数据”。
    • 隐式交互(48篇研究):系统通过自然的注视和语音行为推断用户状态和意图,采用特征级或模型级融合策略。
    • 时间对齐模型至关重要;注视通常领先语音约630毫秒。
    • 多模态系统在减少歧义和增强表达能力方面始终优于单模态基线。
  • 相较基线的优势: 多模态集成在鲁棒性、表达能力和适应性方面优于仅注视或仅语音系统。
  • 实验/评估:
    • 研究涵盖多种任务(如选择、系统控制、参考解析、情感识别),使用手动和自动注释方法进行评估。
    • 验证方法包括交叉验证、K折分割,以及有限的跨任务或跨用户泛化。
  • 局限性与未来工作:
    • 时间对齐挑战、不一致的融合策略,以及受控环境之外的有限评估。
    • 关于注视与语音监控的隐私和透明性伦理问题。
    • 需要更广泛地评估神经多样性和社会约束情境中的应用。

总结

本次综述系统分析了103篇关于注视与语音集成在人机交互中的研究,将其分为显式和隐式两种范式。显式系统利用注视实现空间精度,语音用于命令或数据;隐式系统通过自然行为推断用户状态和意图。综述突出了多模态交互的重复模式、集成策略及挑战,如时间对齐、融合策略选择和隐私问题。通过整合零散研究,为设计鲁棒、自适应和情境感知的多模态系统提供了基础,尤其适用于如XR和AI眼镜等新兴技术。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222828/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791662
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
眼动追踪与注视交互、语音用户界面(VUI)设计、情感化人机对话
work
职业/产业
HCI 研究员、认知科学家、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文