GazeNoter:通过凝视选择LLM建议来匹配用户意图的共驾AR笔记记录

眼动追踪与注视交互混合现实工作空间大语言模型(LLM)的人机协作

研究背景与问题

  • 作者发现了哪些问题或挑战?

    1. 手动笔记可能分散用户注意力并增加认知负担,尤其是在如讲座或会议等需要实时参与的场景中。
    2. 当前通过大型语言模型(LLMs)生成的自动笔记缺乏用户输入,可能无法匹配用户的实际意图。
    3. 现有自动方法局限于语境内笔记(within-context notes),而无法生成超出语境的推导性笔记(beyond-context notes)。
    4. 移动场景(如边走边开的会议)引入了互动沟通和面对面讨论,进一步增加了记录笔记的难度。
  • 为什么这个问题很重要? 实时的高效笔记记录对学习、个人提醒以及会议讨论中提出及时意见非常关键。这不仅影响用户对信息的即时处理能力,还直接影响事后回忆与应用的效果。

  • 研究动机与相关工作

    1. 先前的研究表明,通过用户输入的交互式 NLP 系统可以更接近用户的意图;但这些方法在真实环境中可能面临操作分心等限制。
    2. 增强现实(AR)头戴设备具备透视能力,适合引入低干扰的交互方式,成为一种理想的笔记媒介。
    3. 学界还没有充分探索结合 AR 与 LLM 的笔记解决方案,尤其是能同时支持“语境内”和“超语境”记录的系统。

解决方案

  • 作者提出了哪些方法或解决方案? 提出了 GazeNoter 系统,这是一种实时用户输入结合 LLM 的增强现实(AR)笔记系统,利用视线选择技术快速记录语境内和超语境笔记,同时尽量降低分心与认知负担。

  • 该解决方案的创新之处是什么?

    1. 结合用户输入与 LLM 输出:用户通过选择关键词和句子实时调整和校正 LLM 的输出,以确保笔记能够精确反映用户意图。
    2. 支持多种笔记类型
      • “语境内笔记”:记录当前语境下的关键信息。
      • “超语境笔记”:基于关键词生成推导性内容,超越当前语境。
    3. 使用AR设备和视线选择技术:通过 AR 头戴设备和戒指操作,提供一种低分心、社会友好型的交互模式。
    4. 动态笔记策略:支持用户在高信息密度场景(如会议高峰期)只记录关键词,或者在时间充裕时记录完整句子。
  • 实施步骤是什么?使用了哪些关键技术?

    1. 实时关键词提取:通过 LLM 从实时音频转录中提取有限数量关键字。
    2. 关键词组合与超语境推导
      • 用户选择关键词作为笔记的组成部分。
      • 使用 LLM 推导相关关键词以生成超语境内容。
    3. 候选句子生成:通过选定关键词组织简洁、与语境相关的候选句子供用户选择。
    4. 硬件设计
      • 使用带有眼动追踪功能的 AR 设备进行视线选择。
      • 配备戒指装置用于确认操作,支持快速开启和关闭 AR 显示。
    5. 实验验证:在静态(听讲座)和移动场景(边走边会议)中对系统进行用户评估。

研究成果

  • 取得了哪些具体成果?

    1. GazeNoter 提供了高效的笔记记录系统,既能减少分心又能显著提升笔记与用户意图的匹配程度。
    2. 两次用户研究表明,不仅记录的笔记数量较传统方法(如手写或手机输入)显著更多,质量和用途也更高。
    3. 无论是静态的讲座场景还是移动的会议场景,GazeNoter 在匹配用户意图、记忆提醒和减少认知负担方面表现出色。
  • 与现有解决方案相比,它有哪些优势?

    1. 超语境支持:通过推导关键词与句子生成,GazeNoter 能生成传统自动摘要无法覆盖的内容。
    2. 低分心与高效率:利用 AR 界面和视线操作,无需切换目光和手动打字,显著降低操作负担。
    3. 灵活性与个性化:提供从快速关键词记录到长文句生成的多层级选择。
  • 实验或评估结果是什么?

    1. 静态场景实验
      • GazeNoter 的笔记数量和关键词覆盖均显著高于传统手动文本输入。
      • 使用 GazeNoter 的用户报告的认知负担较低,用户意图适配度评分最高。
    2. 移动场景实验
      • GazeNoter 在走路会议场景中减少了干扰,提高了社交接受度。
      • 有效支持了用户在动态环境中快速、高效地记录笔记。
    3. 与自动 LLM 笔记对比
      • GazeNoter 显著在意图匹配和提醒有效性中优于无输入的自动生成方法。
  • 局限性与未来方向

    1. 眼动追踪精度:现阶段商用 AR 的眼动追踪精度有限,有时会影响用户体验。
    2. 背景知识的整合:系统目前尚未引入用户的背景知识和个性化信息,在关键词推导时可能存在不足。
    3. 硬件适配:现有 AR 设备笨重,虽然未来可能收缩至日常眼镜的大小,当前的显示和交互方式仍有改进空间。
    4. 潜在扩展方向
      • 结合自动生成笔记与用户互动,兼顾覆盖全面性与即时性。
      • 增加动态适应特性,包括更智能的内容布局和动态用户注意力预测。

通过 GazeNoter 的关键创新与研究结果,该研究提出了一种高效、用户友好的实时笔记系统,展现了集成 AR 和 AI 技术在日常工作及学习中的巨大潜力。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/189332/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714294
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
眼动追踪与注视交互、混合现实工作空间、大语言模型(LLM)的人机协作
work
职业/产业
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文