GazePointAR:一种用于可穿戴增强现实中的代词消歧的上下文感知多模态语音助手

眼动追踪与注视交互语音用户界面(VUI)设计AR 导航与情境感知软件工程师与开发者UI/UX 设计师

文献标题

GazePointAR: A Context-Aware Multimodal Voice Assistant for Pronoun Disambiguation in Wearable Augmented Reality

文献信息

  • 主题领域: 增强现实技术、自然语言处理、语音助手、人机交互
  • 关键词: 增强现实、语音助手、多模态输入、注视追踪、指向手势识别、大语言模型

研究背景与问题

  • 当前主流语音助手(例如 Siri 和 Alexa)缺乏对用户空间和时间上下文的理解,导致其对模糊查询(如包含代词的查询)的回答表现实有限。
  • 代词是人类日常交流的重要组成部分,但现有语音助手对其支持较弱,无法有效解决代词未明确指代的问题(即代词消歧问题)。
  • 此问题的重要性在于通过改进语音助手的能力,使其像人类一样自然地理解上下文并进行互动,从而提升用户体验。

解决方案

方法与创新

  • GazePointAR 的提出:
    • GazePointAR 是一个针对可穿戴增强现实设计的上下文感知语音助手,结合了注视追踪、指向手势和对话历史来解决用户查询中代词的模糊指代问题。
    • 通过实时计算机视觉技术,识别用户视野中的对象,并调用大语言模型(GPT-3或GPT-3.5)生成答案。
    • 提出了一个新的多模态交互方法,使用户可以通过看、指向和口述简短自然语言查询,与系统进行交互。

实施步骤与关键技术

  1. 用户激活: 用户通过说“Hey Glass”启动系统,系统进入“倾听模式”以检测用户语音查询。
  2. 场景分析:
    • 捕获用户视野的图像。
    • 使用计算机视觉技术提取图像中的对象、文本和人脸信息。
  3. 注视追踪与手势识别:
    • 利用内置模块获取用户注视位置的三维坐标。
    • 实现指向手势识别,并结合实时空间网格检测用户的指向目标。
  4. 查询构建与代词替换:
    • 根据注视和手势信息生成清晰的短语代替模糊代词。
    • 使用 Prompt Engineering 和 GPT 技术进一步提升代词消歧的智能性。
  5. 答案生成与反馈:
    • 将优化后的查询发送至大语言模型(GPT-3.5),获取答案,并通过文本转语音功能朗读给用户。

研究成果

具体成果

  • 在实验中开发了一个功能全面的上下文感知语音助手原型,并通过两项研究检验其性能与用户反馈:
    1. 实验室研究: 比较 GazePointAR 与现有语音助手(Google Voice Assistant 和 Google Lens)的表现。
    2. 第一人称日记研究: 记录研究者在真实场景下连续 5 天使用 GazePointAR 的体验。

实验与评估结果

  • 实验室中参与者对比结果:

    • 与 Google Voice Assistant 和 Google Lens 相比,用户认为 GazePointAR 更自然、更像人类助手。
    • GazePointAR 在使用代词进行语音查询时表现突出,例如可以更快速且准确地识别“this”“that”等代词指代的对象。
    • 主要问题包括答案的单一性及访问历史上下文的能力不足。
  • 第一人称日记研究结果:

    • 在真实环境中,对复杂查询(如“这件衣服太贵了,推荐类似的品牌”)表现良好,但对一些缺乏上下文信息或需要多代词查询的任务仍有局限。
    • 主体满意其自然和直观的交互性能,但指出需要改进持续跟踪注视数据和细化目标识别。

与现有解决方案的优势

  • 多模态支持: 融入注视追踪和指向手势,支持传统语音助手所不具备的上下文感知能力。
  • 代词识别能力增强: 提升用户构造简单查询的能力,即能通过自然语言中的模糊表达与设备交互。
  • 实时性与互动性: 提供快速响应且能够解释答案的功能。

局限性与未来方向

  • 局限性:
    • 难以处理多个代词及历史指代的查询。
    • 对复杂对象的识别能力不足。
    • 在公开场合使用时可能影响用户隐私和舒适度。
    • 用户需要长时间注视对象,可能导致疲劳。
  • 未来方向:
    • 支持连续注视跟踪以捕获动态上下文。
    • 提供多种查询答案,并允许用户选择或编辑答案。
    • 优化机器学习模型以识别更多对象类别。
    • 平衡系统隐私保护与功能拓展。

总结

本文展示了一种基于增强现实设备的上下文感知语音助手,能够通过多模态输入解决代词消歧问题。研究表明 GazePointAR 提升了语音交互的自然性和精准性,并探索了通过增强现实技术与大语言模型结合的创新潜力。随着技术的进一步优化,未来的上下文感知语音助手将更广泛地支持自然语言查询与动态交互,从而显著改善用户体验。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/147184/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642230
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
眼动追踪与注视交互、语音用户界面(VUI)设计、AR 导航与情境感知
work
职业/产业
软件工程师与开发者、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文