Satori 悟り: 基于信念-欲望-意图用户模型的主动AR助手

AR 导航与情境感知大语言模型(LLM)的人机协作环境感知与上下文计算

研究背景与问题

  • 发现的问题或挑战: 当前的增强现实 (AR) 助手主要以反应式交互为基础,即系统基于用户特定的输入或环境触发行为。这种方法面临以下主要挑战:
    1. 缺乏主动交互,导致用户须频繁发出明确指令;
    2. 现有的 AR 助手通常依赖固定规则,缺乏灵活性和可扩展性;
    3. 在多步骤任务的连续指导与多任务切换方面表现不佳。
  • 问题的重要性: 主动式的 AR 助手有潜力通过更有效地理解用户的动作与环境,提供及时的指导,从而减少用户的认知负担,提高任务完成效率。适当的指导时机对用户体验和任务完成情况尤为关键。
  • 研究动机与相关工作: 作者基于深远的虚拟助手和认知心理学研究背景,提出使用 "信念-愿望-意图" (Belief-Desire-Intention, BDI) 模型的可能性,以改善 AR 助手的主动性。BDI 模型已在软件工程与认知建模中被广泛研究,但尚未应用于 AR 领域。

解决方案

  • 提出的方法: 作者开发了一个新型的 AR 系统 Satori,该系统结合 BDI 模型与大型多模态语言模型 (LLM),如 GPT-4V,以实现主动式的 AR 交互。
  • 创新点:
    1. 将心理学中的 BDI 模型适配为用于 AR 场景的用户建模框架;
    2. 通过结合视觉模型与 LLM,优化情景、任务和用户动作的洞察能力;
    3. 动态实现多模态内容生成,包括文本、图像和音频等指导形式;
    4. 提供实时、自适应的任务指导,能够支持任务切换和分步确认,从而提高对复杂环境的普适适应能力。
  • 实施步骤:
    1. BDI 模型改编:
      • 信念 (Belief):通过视觉感知模块(场景检测、对象识别)以及用户的动作历史记录,推导用户当前的环境认知。
      • 愿望 (Desire):利用 LLM 推断用户的高层次任务目标,并通过用户确认来提升精确度。
      • 意图 (Intention):预测用户即将执行的下一步动作,为步骤指导提供定时与内容支持。
    2. 动态内容生成:
      • 利用 DALL-E 等图像生成模型为任务生成场景适配的说明性图像;
      • 动态配置指导的形式(文本、音频、工具提示等)。
    3. 时间预测与确认机制:
      • 实现实时动作完成检测与预测,减少响应延迟;
      • 通过用户确认界面确保指导的准确性。
    4. 接口设计:
      • 提供透明的任务跟踪与用户交互界面,显示任务目标、待完成的子步骤及对象定位。

研究成果

  • 具体成果:
    1. 性能表现:
      • 使用常见任务数据集(如 GTEA)及作者生成的视频数据评估,Satori 在任务场景理解、用户动作预测、指导时间与内容生成方面达到了较高精度。
      • 与专业设计的 Wizard-of-Oz (WoZ) 基线系统相比,Satori 在多用户研究中的计时准确性(81.69%)和指导模态预测的平均召回率(75.12%)表现接近。
    2. 用户研究:
      • 在 16 人用户实验中,Satori 被评为在内容可理解性、任务匹配性和响应及时性上与 WoZ 系统效果类似。
      • 用户满意度在多个维度(如指导时机、可用性和实用性)接近甚至优于基线;在 NASA-TLX 认知负担评估中,Satori 与 WoZ 系统无显著差异。
    • 文本和多模态内容生成受到用户积极评价,如箭头定位和说明性图像在指导中表现出显著价值。
  • 相较现有解决方案的优势:
    • 不依赖预定义的任务规则或手动配置,系统更具扩展性;
    • 自动化生成内容和更新指导,减少对重复设计的需求;
    • 提升了对多任务管理和用户意图检测的支持,增加了对实时情境的响应能力。
  • 局限性与未来方向:
    1. 技术局限:
      • 系统存在 2-3 秒的延迟,可能影响对快速任务的指导;
      • 高层任务预测在某些情况下仍表现不够准确。
    2. 设备限制:
      • 当前的 AR 头显(如 HoloLens 2)视野有限,可能错过用户关键动作;
      • 需要更优化的传感器设备(如第三视角摄像头)以提供更全面的环境理解。
    3. 未来研究方向:
      • 扩展到更广泛的领域(如工业、医疗)以探索领域特定任务的适用性;
      • 结合神经信号或增强的跨模态方法改善对用户信念的建模准确性;
      • 引入支持多用户协作和复杂社会交互的功能,例如任务分工和群体目标建模。

通过以上分析可以看出,Satori 在主动式 AR 辅助系统设计中迈出了重要一步,其在普适性与交互效果上的表现具有广阔的潜力和应用前景。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188444/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714188
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
9 位作者
sell
研究子方向
AR 导航与情境感知、大语言模型(LLM)的人机协作、环境感知与上下文计算
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文