整合视线和语音以实现隐式交互
眼动追踪与注视交互语音用户界面(VUI)设计
文献标题
Integrating Gaze and Speech for Enabling Implicit Interactions
文献信息
- 主题领域: 人机交互 (Human-Computer Interaction, HCI)
- 关键词: 隐式注释, 自然凝视, 语音接口, 自然语言处理, 语义相似性
研究背景与问题
-
问题与挑战:
- 使用单一输入模态(如语音或凝视)往往受到输入模态局限性的影响,导致人机交互的自然性与便利性受到制约。
- 现有技术中,语音多用于显式输入(如明确的语音指令),而天然语音的语义与复杂性未得到充分利用。此外,仅依赖凝视模式进行注释在某些情况下(如快速扫描文本)存在性能上的不足。
- 当前基于凝视的隐式交互技术在面对更自然的用户行为时可靠性不足,尤其当凝视模式与语音注释之间没有显式映射时。
-
研究重要性:
- 通过结合语音和凝视输入模态,可以更好地捕获用户意图和上下文信息,从而提高人机交互中的自然性和精确性。
- 对于数字阅读环境或类似场景中,精确的语音注释锚定在文本上对用户体验和任务效率至关重要。
-
研究动机与相关工作:
- 经典研究作品(如 Bolt 的“Put-that-there”)显示,将多个输入模态结合可以相辅相成弥补彼此的局限性。
- 语音与凝视的结合被广泛研究,然而多用于显式输入场景,缺乏隐式交互场景的充分研究。
- 当前基于凝视的技术在快速阅读时往往表现不佳,而语音自然模式的含丰富语义信息,却未与凝视数据集成用于更复杂场景的交互。
解决方案
-
方法或解决方案:
- 提出一个基于机器学习的数据处理管道,结合用户的自然凝视行为与语音注释的语义信息(通过 BERT 语义嵌入)以及语音与凝视之间的同步性,来精确预测语音注释对应的文本段落。
- 管道包括多阶段特征提取:结合凝视模式特征、语音语义相似性特征、以及隐式引用特征。
-
创新之处:
- 将语音和凝视模态紧密集成,捕获无法通过单一模态获取的上下文信息。
- 针对语音注释的隐式锚定任务,提取了多种新颖的特征,包括凝视与语音之间同步关系的特征值。
- 在用户自然行为的基础上构建多模态分类器,使得模型对各类复杂语音注释形式具有更高的鲁棒性和适应性。
-
实施步骤与技术:
- 数据预处理: 从语音数据中提取注释片段,并从凝视数据中计算相关的凝视模式,标定文本段落为候选区域。
- 特征提取:
- 使用 Sentence-BERT 模型捕获语音和文本语义嵌入的相似性。
- 提取隐式引用特征,包括凝视停留时间、数量、最小距离等。
- 构建针对用户全局阅读模式的预测特征。
- 模型训练: 使用逻辑回归模型,同时整合语音与凝视特征,分别进行用户依存及独立模式的交叉验证。
- 评估分析: 对模型进行 F1-Score、平均精确度 (AP) 测试,并基于 SHAP 分析特征重要性。
研究成果
-
具体成果:
- 提出的算法在语音注释精确锚定任务中获得了平均 F1-Score 为 0.90 的性能。
- 通过结合凝视与语音模态,分类器在不同类型的注释(内容相关型、反思型、隐性引用型)中普遍提升性能。
- 显示了对隐式语音注释的鲁棒性,例如在快速扫描或隐式引用场景中相比现有凝视-单一模态方案改进了 12% 的平均精确度。
-
对比优势:
- 相较于现有仅基于凝视的隐式交互方案(如 GAVIN),该研究的多模态方法显著提高了分类准确性,尤其在文本接近或语音自然表达复杂情况下表现更优。
-
实验与评估结果:
- 用户依存模型与独立模型均展现出对不同语音注释场景的强大适应性。
- 针对语音转写的准确性进行分析,即使使用误差较高的自动语音识别 (ASR),模型性能仍优于仅基于凝视的方法。
-
局限性与未来方向:
- 局限性:
- 对隐式引用语音的识别依赖于某些指代词(如“this”),复杂语言模式下可能失效。
- 仅验证了文本锚定,缺乏对其他数字内容(如视频、图像)的研究。
- 未精确到句子或单词层级的锚定。
- 未来方向:
- 开发更全面的 NLP 技术以扩展隐式引用识别范围。
- 探索对其他数字内容类型(如 UI 元素、数据可视化)的适用性。
- 提升模型对语义和结构更复杂文本的适应能力(如多段文本嵌入算法 Doc2Vec)。
- 局限性:
总结而言,该研究成功验证了语音与凝视模态结合的可行性,为隐式人机交互设计提供了可靠的技术基础,具备在更广泛场景中应用的潜力。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何结合语音与注视数据以实现隐式的人机交互?分类: 社交互动、远程联系与关系体验同类问题arrow_forward
- 注视模式与语音语义之间的特征提取如何提升隐式注释的精确度?分类: 社交互动、远程联系与关系体验同类问题arrow_forward
- 结合语音与注视的分类器是否能适应复杂的语音注释场景?分类: 社交互动、远程联系与关系体验同类问题arrow_forward
lightbulb
现实痛点
1- 用户在快速浏览文本时,现有注视交互技术效率和精度不足。分类: 社交互动、远程联系与关系体验同类问题arrow_forward
- 100%
使用非语言声音提供方向刺激的雷达隐喻评估
CHI '19· 眼动追踪与注视交互 +1
- 100%
TAGSwipe:触控辅助 gaze swipe 文本输入
CHI '20· 眼动追踪与注视交互 +1
- 100%
哈默:通过凝视和哼唱进行文本输入
CHI '21· 眼动追踪与注视交互 +1
- 100%
EyeSayCorrect:基于眼球追踪和语音的移动设备无接触文本修正方法
IUI '22· 眼动追踪与注视交互 +1
- 67%
M^2Silent: 通过共享空间中的多方向扬声器实现多用户无声语音交互
CHI '25· 眼动追踪与注视交互 +2
- 67%
ThumbAir:头戴显示器的空中打字系统
UbiComp '23· 眼动追踪与注视交互 +2
- 67%
Viago:探索移动社交媒体消费中的视觉-音频模态转换
UIST '25· 眼动追踪与注视交互 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3502134
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
眼动追踪与注视交互、语音用户界面(VUI)设计
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
7 篇相关论文