Guided Reality:基于大语言模型和视觉模型的富视觉增强现实任务指导生成
AR 导航与情境感知大语言模型(LLM)的人机协作职业培训师与教练软件工程师与开发者
大型语言模型(LLMs)已能自动生成多种物理任务的分步骤增强现实(AR)指令。然而,现有基于LLM的AR指导往往缺乏丰富的视觉增强,难以有效将指令嵌入空间上下文以提升用户理解。我们提出了Guided Reality,一个全自动化的AR系统,能够基于分步骤指令生成嵌入式的动态视觉指导。该系统整合LLMs和视觉模型,实现以下功能:1)根据用户查询生成分步骤指令;2)识别适当的视觉指导类型;3)提取现实世界中关键交互点的空间信息;4)在物理空间中嵌入视觉指导以支持任务执行。我们基于用户手册语料库定义了五类视觉指导,并提出基于当前步骤的识别策略。我们通过用户研究(N=16)评估该系统,参与者完成真实世界任务并探索系统在野外环境中的应用。此外,四名培训师分享了将Guided Reality整合到培训工作流程中的见解。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3746059.3747784
一眼看懂
fact_check论文快照
dataset
来源
UIST
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
AR 导航与情境感知、大语言模型(LLM)的人机协作
work
职业/产业
职业培训师与教练、软件工程师与开发者
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文