Satori 悟り: 基于信念-欲望-意图用户模型的主动AR助手
作者
AR 导航与情境感知大语言模型(LLM)的人机协作环境感知与上下文计算
研究背景与问题
- 发现的问题或挑战:
当前的增强现实 (AR) 助手主要以反应式交互为基础,即系统基于用户特定的输入或环境触发行为。这种方法面临以下主要挑战:
- 缺乏主动交互,导致用户须频繁发出明确指令;
- 现有的 AR 助手通常依赖固定规则,缺乏灵活性和可扩展性;
- 在多步骤任务的连续指导与多任务切换方面表现不佳。
- 问题的重要性: 主动式的 AR 助手有潜力通过更有效地理解用户的动作与环境,提供及时的指导,从而减少用户的认知负担,提高任务完成效率。适当的指导时机对用户体验和任务完成情况尤为关键。
- 研究动机与相关工作: 作者基于深远的虚拟助手和认知心理学研究背景,提出使用 "信念-愿望-意图" (Belief-Desire-Intention, BDI) 模型的可能性,以改善 AR 助手的主动性。BDI 模型已在软件工程与认知建模中被广泛研究,但尚未应用于 AR 领域。
解决方案
- 提出的方法: 作者开发了一个新型的 AR 系统 Satori,该系统结合 BDI 模型与大型多模态语言模型 (LLM),如 GPT-4V,以实现主动式的 AR 交互。
- 创新点:
- 将心理学中的 BDI 模型适配为用于 AR 场景的用户建模框架;
- 通过结合视觉模型与 LLM,优化情景、任务和用户动作的洞察能力;
- 动态实现多模态内容生成,包括文本、图像和音频等指导形式;
- 提供实时、自适应的任务指导,能够支持任务切换和分步确认,从而提高对复杂环境的普适适应能力。
- 实施步骤:
- BDI 模型改编:
- 信念 (Belief):通过视觉感知模块(场景检测、对象识别)以及用户的动作历史记录,推导用户当前的环境认知。
- 愿望 (Desire):利用 LLM 推断用户的高层次任务目标,并通过用户确认来提升精确度。
- 意图 (Intention):预测用户即将执行的下一步动作,为步骤指导提供定时与内容支持。
- 动态内容生成:
- 利用 DALL-E 等图像生成模型为任务生成场景适配的说明性图像;
- 动态配置指导的形式(文本、音频、工具提示等)。
- 时间预测与确认机制:
- 实现实时动作完成检测与预测,减少响应延迟;
- 通过用户确认界面确保指导的准确性。
- 接口设计:
- 提供透明的任务跟踪与用户交互界面,显示任务目标、待完成的子步骤及对象定位。
- BDI 模型改编:
研究成果
- 具体成果:
- 性能表现:
- 使用常见任务数据集(如 GTEA)及作者生成的视频数据评估,Satori 在任务场景理解、用户动作预测、指导时间与内容生成方面达到了较高精度。
- 与专业设计的 Wizard-of-Oz (WoZ) 基线系统相比,Satori 在多用户研究中的计时准确性(81.69%)和指导模态预测的平均召回率(75.12%)表现接近。
- 用户研究:
- 在 16 人用户实验中,Satori 被评为在内容可理解性、任务匹配性和响应及时性上与 WoZ 系统效果类似。
- 用户满意度在多个维度(如指导时机、可用性和实用性)接近甚至优于基线;在 NASA-TLX 认知负担评估中,Satori 与 WoZ 系统无显著差异。
- 文本和多模态内容生成受到用户积极评价,如箭头定位和说明性图像在指导中表现出显著价值。
- 性能表现:
- 相较现有解决方案的优势:
- 不依赖预定义的任务规则或手动配置,系统更具扩展性;
- 自动化生成内容和更新指导,减少对重复设计的需求;
- 提升了对多任务管理和用户意图检测的支持,增加了对实时情境的响应能力。
- 局限性与未来方向:
- 技术局限:
- 系统存在 2-3 秒的延迟,可能影响对快速任务的指导;
- 高层任务预测在某些情况下仍表现不够准确。
- 设备限制:
- 当前的 AR 头显(如 HoloLens 2)视野有限,可能错过用户关键动作;
- 需要更优化的传感器设备(如第三视角摄像头)以提供更全面的环境理解。
- 未来研究方向:
- 扩展到更广泛的领域(如工业、医疗)以探索领域特定任务的适用性;
- 结合神经信号或增强的跨模态方法改善对用户信念的建模准确性;
- 引入支持多用户协作和复杂社会交互的功能,例如任务分工和群体目标建模。
- 技术局限:
通过以上分析可以看出,Satori 在主动式 AR 辅助系统设计中迈出了重要一步,其在普适性与交互效果上的表现具有广阔的潜力和应用前景。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何将信念-愿望-意图(BDI)模型应用于增强现实(AR)场景下以提高系统的主动交互能力?分类: XR中NPC对话与角色交互同类问题arrow_forward
- 结合视觉模型和大语言模型(LLMs),如何提升AR助手对用户行为和任务场景的理解能力?分类: XR中NPC对话与角色交互同类问题arrow_forward
- 如何动态生成多模态内容以支持用户的任务切换和多步骤任务的连续指导?分类: XR中NPC对话与角色交互同类问题arrow_forward
lightbulb
现实痛点
1- 用户需频繁下指令,现有AR助手难以支持复杂任务的连续指导。分类: XR中NPC对话与角色交互同类问题arrow_forward
- 67%
NavigaTone:在移动音乐聆听中无缝嵌入导航提示
CHI '18· AR 导航与情境感知 +1
- 67%
OmniActions: 使用大语言模型预测对现实世界多模态感官输入的数字动作
CHI '24· 大语言模型(LLM)的人机协作 +1
- 67%
与导航应用程序的交互方式
CHI '25· AR 导航与情境感知 +1
- 67%
在移动中使用AR:在变化增强密度时对虚拟和物理目标的关注
CHI '25· AR 导航与情境感知 +1
- 67%
在环境信息环境中感知显眼性
CHI '25· AR 导航与情境感知 +1
- 67%
通过增强现实眼镜视角审视双方互动中的协商
DIS '23· AR 导航与情境感知 +1
- 67%
自适应增强现实工作空间的行走:设计与使用模式
IUI '19· AR 导航与情境感知 +1
- 67%
葡萄牙军事背景下头戴式增强现实应用的首次探索
MobileHCI '23· AR 导航与情境感知 +1
- 67%
混合现实界面的情境感知在线自适应
UIST '19· AR 导航与情境感知 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714188
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
9 位作者
sell
研究子方向
AR 导航与情境感知、大语言模型(LLM)的人机协作、环境感知与上下文计算
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文