CARING-AI:通过生成式人工智能实现上下文感知的增强现实指令创作
作者
AR 导航与情境感知生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作软件工程师与开发者UI/UX 设计师AI/ML 研究员与工程师
研究背景与问题
-
问题与挑战:
- 增强现实(AR)指令提供一种沉浸式的学习和交互方式,通过将数字内容渲染到真实环境中帮助用户理解复杂任务。但当前利用人工智能生成内容 (AIGC) 的方法在 AR 应用中缺乏足够的上下文感知能力。
- 现有方法(包括基于运动捕捉的展示式编程)虽然可以生成 AR 动画内容,但受到硬件复杂性、上下文适用性和专业知识要求的限制。
- 基于生成式 AI 的方法缺乏生成指令与用户实际环境的空间和时间上的贴合性。
-
重要性:
- 在实际应用场景中可根据用户和环境上下文生成适配指令对于真实场景的有效指导具有重要意义。
- 上下文感知可以显著提升 AR 指令的适应性、学习效果及互动性。
-
研究动机与相关工作:
- 动机:利用生成式 AI(如文本生成模型和运动扩散模型)生成更适应复杂现实场景的 AR 指令并去除对复杂硬件设备和编程技能的需求。
- 相关工作:较早采用生成对抗网络(GAN)生成内容在 AR 应用中已有探索,但主要关注静态3D图像或简单环境设置。CARING-AI 则旨在实现动态的上下文相关的 3D 人形动画。
解决方案
-
方法与解决方案:
- CARING-AI 系统提出了一种通过生成式 AI(如 ChatGPT 和扩散模型)生成上下文相关的人形 AR 动画指令的方法。
-
创新之处:
- 开发了一种无需编程和运动捕捉的工作流,生成能适应人类、环境和系统上下文的AR指令。
- 实现了基于扩散模型的动态平滑算法,使生成的多步骤动画在时序过渡上更加自然。
- 提供了用户友好的 AR 界面,支持任务文本描述输入、环境扫描、生成指令动画及指令的可视化和编辑。
-
实施步骤:
- 生成文本指令:
- 使用 ChatGPT 生成任务的逐步说明,用户可以编辑和调整指令。
- 环境扫描:
- 用户通过佩戴 HoloLens2 扫描真实环境并提供物体位置信息。
- 动画生成:
- 基于用户提供的文本指令和上下文,扩散模型生成人形动作动画,包括局部和全局的空间、时间上下文映射。
- 可视化与编辑:
- 提供一个交互式的 AR 界面完成动画的调整、修改和预览。
- 生成文本指令:
研究成果
-
具体成果:
- 制定了应对不同上下文和内容范围的设计空间。
- 成功开发了一个系统,允许用户生成和编辑 AR 指令动画,包括对本地(如手部对象交互)和全局(如环境中路径导航)的上下文适应。
-
与现有解决方案的优势:
- 相较于基于编程或展示的内容生成方法,CARING-AI 不需要用户具备专业知识,且无需昂贵的运动捕捉设备。
- 支持更复杂、更自然的多步骤任务动画,弥补了现有方法在时间连续性和平滑性上的缺陷。
-
实验结果:
- 实验1:算法性能评估: 相较于基准算法(GMD),CARING-AI 的生成动画在时序连续性上显著改善(过渡距离减少至 0.03m),动画质量具有较高的空间对齐精度(误差小于 0.1m)。
- 实验2:可用性验证: 用户将 CARING-AI 的系统可用性评为 83.21(满分100),对动画质量和生成便捷性给予高度认可。
- 实验3:互动测试: 与基于展示的编程对比,CARING-AI 显著减少任务完成时间和错误率,且用户在心理和身体负担方面的反馈优于基准方法。
-
局限性与未来方向:
- 局限性:
- 系统目前的手部与物体交互生成能力有限,无法支持复杂的物体形变与深度交互。
- 一些硬件限制(如设备视野范围、计算延迟)可能对用户体验产生一定影响。
- 未来方向:
- 增强手部与物体的高保真交互能力,引入更多支持柔性和分段物体的生成算法。
- 集成更多生成内容类型(例如图像、音频、视频)以丰富 AR 场景。
- 提高系统的实时性能,并探索结合更大模型和云计算的可能性。
- 局限性:
这篇论文通过 CARING-AI 系统展示了生成式 AI 在 AR 指令生成中的潜力,并为未来基于生成算法的 AR 开发提供了新的思路和应用方向。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何利用生成式人工智能生成适应复杂实际场景的AR(增强现实)任务指导动画?分类: AR任务指导、教程与提示设计同类问题arrow_forward
- 生成的AR指令如何能够动态适应用户、环境及系统的多种情境?分类: AR任务指导、教程与提示设计同类问题arrow_forward
- 可以通过哪些算法改进AR动画的时空连续性和自然性?分类: AR任务指导、教程与提示设计同类问题arrow_forward
lightbulb
现实痛点
1- 用户难以在真实环境中生成情境适应的AR指导内容。分类: AR任务指导、教程与提示设计同类问题arrow_forward
- 83%
MUD:面向大规模和噪声过滤的现代风格UI建模UI数据集
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 83%
生成式AI的角色如何影响人机协作工作中价值感知
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 83%
agentAR:使用工具增强的基于LLM的自主代理创建增强现实应用
UIST '25· AR 导航与情境感知 +2
- 71%
ReactGenie:使用大型语言模型开发复杂多模式交互的框架
CHI '24· 语音用户界面(VUI)设计 +2
- 71%
AI增强的头脑风暴:研究LLM在团队创意生成中的应用
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 71%
知识工作中的人工智能生成技术:数据导航和决策制定的设计影响
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 71%
超越代码生成:LLM支持的程序设计空间探索
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 71%
使用提示进行原型设计:协作软件团队在生成式AI设计中的新兴方法和挑战
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 71%
创建设计资源以支持AI概念的构思
DIS '23· 生成式AI(文本、图像、音乐、视频) +2
- 71%
GPTVoiceTasker:通过动态界面探索与学习提升多步骤移动任务效率
UIST '24· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713348
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
AR 导航与情境感知、生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
软件工程师与开发者、UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文