ARify:利用叙事教学视频为程序化任务创建增强现实教程
作者
AR 导航与情境感知原型设计与用户测试混合现实工作空间大学教授与研究人员软件工程师与开发者UI/UX 设计师
文献标题
ARify: Leveraging Narrated Instructional Videos to Create Augmented Reality Tutorials for Procedural Tasks
出版信息
- 主题领域: 从教学视频生成增强现实(AR)教程
- 关键词: 增强现实, 教学视频, 程序性任务, 教程创作, 视觉-语言模型, AR 表示, 可用性, 自动化, 设计空间
背景与问题
- 问题 / 挑战: 创建程序性任务的增强现实(AR)教程需要较高的 AR 创作专业知识,这限制了缺乏技术技能的领域专家的可及性。
- 重要性: AR 教程通过提供情境化的逐步指导来提高任务学习效果,减少认知负担,并增强学习成果。降低 AR 教程创作的门槛可以使更多人能够使用这种高效的学习媒介。
- 动机与相关工作: 现有系统要么依赖于在游戏引擎中手动创作 AR 教程,要么使用基于规则的方法,这些方法通常针对特定任务且缺乏通用性。尽管基于演示和叙述增强的系统提高了可解释性,但仍然需要 AR 专业知识。新兴的视觉-语言模型(VLMs)在自动化教程生成方面显示出潜力,但尚未应用于叙述性教学视频的 AR 教程创作。
解决方案
- 提出的方法: ARify 是一个半自动创作系统,利用视觉-语言模型(VLM)和交互编辑工具,将叙述性教学视频转化为 AR 教程。
- 创新点:
- 基于教学视频内容分析,建立了将教学意图、策略与 AR 表示相链接的设计空间。
- 基于 VLM 的系统,可从叙述性教学视频中自动生成教程结构和 AR 表示。
- 提供交互式界面(教程结构编辑器和 AR 编辑器),用于优化和定制 AR 教程。
- 通过数值和用户研究进行实证验证,证明其有效性和可用性。
- 流程与关键技术:
- 内容分析: 识别视频中的教学意图和策略,并将其映射到 AR 表示。
- 教程规划器: 使用 VLM 将视频解析为任务 → 步骤 → 动作的层级结构,并推荐 AR 表示。
- AR 构建器: 利用感知模块(如物体检测、姿态估计和空间定位)配置 AR 表示。
- 创作界面: 为用户提供工具以优化教程结构和 AR 元素。
- 部署: 将 AR 教程导出到头戴式显示设备(HMDs),实现空间定位的逐步指导。
结果
- 具体发现:
- ARify 在三种任务类型(装配、维修、培训)中实现了 88.8% 的序列准确率和平均 90.1% 的 F1 分数。
- 在教学策略的各类别中表现强劲,F1 分数均高于 80%。
- 可用性研究参与者对系统评价较高(SUS 得分: 80.00 ± 14.85),认为其直观且高效地支持 AR 教程创作。
- 相较基线的优势:
- 相较于零样本条件,少样本演示显著提高了性能(所有 p < 0.001)。
- ARify 的多任务演示策略在任务类型的通用性上优于任务特定配置(所有 p < 0.01)。
- 实验 / 评估:
- 数值研究: 在 36 个额外的教学视频(共 2371 个标注策略)上评估了 ARify 的规划准确性和策略级性能。
- 可用性研究: 18 名参与者使用系统为三种机器任务创建 AR 教程,评估了易用性、满意度和有效性。
- 局限性与未来工作:
- 感知模块和 VLM 分割的局限性导致在处理密集杂乱、小型物体和细微动作技能时存在挑战。
- AR 表示库有限;未来工作可扩展以包含更多专业化元素。
- 当前实现针对 AR-HMDs;未来扩展可支持移动 AR 平台和多模态反馈。
总结
ARify 是一个半自动系统,利用视觉-语言模型和交互式创作工具,将叙述性教学视频转化为 AR 教程。该系统在生成准确且可用的 AR 教程方面表现出色,涵盖了多种程序性任务,显著降低了新手用户的使用门槛。尽管当前在处理复杂场景和 AR 表示库方面存在局限性,ARify 为可扩展的 AR 教程创作奠定了坚实的基础,并为未来在通用性、表示多样性和跨平台适应性方面的改进提供了机会。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 71%
Spatialstrates:通过空间超媒体实现跨现实协作
UIST '25· VR 中的社交与协作 +2
- 67%
RemapVR:用于VR中重新映射交互快速原型设计的沉浸式创作工具
CHI '25· 混合现实工作空间 +1
- 67%
穿越双重现实:研究在桌面和增强现实环境之间转换3D对象的技术
CHI '25· AR 导航与情境感知 +1
- 67%
超越输入流:使用转录序列使文本输入评估更加灵活
UIST '19· 原型设计与用户测试
- 67%
DepthLab:移动增强现实中基于深度图的实时3D交互
UIST '20· AR 导航与情境感知 +1
- 67%
Rapido:通过编程演示创建交互式AR体验的原型设计
UIST '21· AR 导航与情境感知 +1
- 67%
AUIT——用于设计XR应用的自适应用户界面工具包
UIST '22· AR 导航与情境感知 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790715
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
AR 导航与情境感知、原型设计与用户测试、混合现实工作空间
work
职业/产业
大学教授与研究人员、软件工程师与开发者、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
7 篇相关论文