多模态人机交互中的目光与语音:范围综述
作者
眼动追踪与注视交互语音用户界面(VUI)设计情感化人机对话HCI 研究员认知科学家UI/UX 设计师
文献标题
Gaze and Speech in Multimodal Human-Computer Interaction: A Scoping Review
出版信息
- 主题领域: 多模态人机交互,重点研究注视与语音的集成。
- 关键词: 多模态交互、注视输入、语音输入、人机交互、显式交互、隐式交互、时间对齐、融合策略、自适应系统、隐私。
背景与问题
- 问题/挑战: 尽管已有数十年的研究,注视与语音在人机交互中的集成仍然是零散的,缺乏对重复模式、挑战和机遇的系统性总结。
- 重要性: 注视和语音具有互补优势——注视提供空间定位,而语音传递语义信息——使其结合成为直观、自适应和免手操作交互的关键,尤其在如XR和AI眼镜等新兴技术中。
- 动机与相关工作: 以往的综述通常广泛关注多模态交互,或分别研究注视或语音,而未分析两者的结合使用。本次综述通过系统性分析103篇研究,填补这一空白,揭示注视与语音结合的集成策略、任务领域及独特挑战。
解决方案
- 提出的方法: 通过综述将注视与语音交互分为显式(有意控制信号)和隐式(行为线索)两种范式,分析其集成策略、特征表示及应用领域。
- 创新性:
- 首次对注视与语音作为统一输入通道进行全面综合。
- 对多模态集成策略和特征表示进行详细分析。
- 绘制利用注视与语音的任务和领域图谱,突出设计挑战与机遇。
- 流程与关键技术:
- 在ACM-DL、IEEE Xplore、Scopus和Web of Science中使用精炼关键词进行结构化检索。
- 筛选与纳入标准聚焦于单用户HCI中的注视与语音输入模式。
- 按交互类型、集成策略和任务领域对研究进行编码。
- 通过功能角色、融合策略和计算模型分析显式与隐式交互范式。
结果
- 具体发现:
- 显式交互(55篇研究):注视提供空间精度,语音传递命令或数据。常见组合包括“注视指向,语音作为命令”和“注视指向+确认,语音作为数据”。
- 隐式交互(48篇研究):系统通过自然的注视和语音行为推断用户状态和意图,采用特征级或模型级融合策略。
- 时间对齐模型至关重要;注视通常领先语音约630毫秒。
- 多模态系统在减少歧义和增强表达能力方面始终优于单模态基线。
- 相较基线的优势: 多模态集成在鲁棒性、表达能力和适应性方面优于仅注视或仅语音系统。
- 实验/评估:
- 研究涵盖多种任务(如选择、系统控制、参考解析、情感识别),使用手动和自动注释方法进行评估。
- 验证方法包括交叉验证、K折分割,以及有限的跨任务或跨用户泛化。
- 局限性与未来工作:
- 时间对齐挑战、不一致的融合策略,以及受控环境之外的有限评估。
- 关于注视与语音监控的隐私和透明性伦理问题。
- 需要更广泛地评估神经多样性和社会约束情境中的应用。
总结
本次综述系统分析了103篇关于注视与语音集成在人机交互中的研究,将其分为显式和隐式两种范式。显式系统利用注视实现空间精度,语音用于命令或数据;隐式系统通过自然行为推断用户状态和意图。综述突出了多模态交互的重复模式、集成策略及挑战,如时间对齐、融合策略选择和隐私问题。通过整合零散研究,为设计鲁棒、自适应和情境感知的多模态系统提供了基础,尤其适用于如XR和AI眼镜等新兴技术。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791662
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
眼动追踪与注视交互、语音用户界面(VUI)设计、情感化人机对话
work
职业/产业
HCI 研究员、认知科学家、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文