通过生成式AI赋能XR:平衡超级能力与风险
作者
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作沉浸感与临场感研究VR 中的社交与协作AI/ML 研究员与工程师HCI 研究员UI/UX 设计师
文献标题
Empowered XR through Generative AI: Balancing Superpowers and Risks
出版信息
- 主题领域: 生成式人工智能与扩展现实(XR)的整合,以增强人类能力并应对相关风险。
- 关键词: 生成式人工智能,扩展现实,大型语言模型,认知增强,感官提升,环境操控,行为风险,用户自主性,伦理透明性,沉浸式技术。
背景与问题
- 问题/挑战: 现有XR技术在复制真实场景、支持协作以及提供详细的上下文理解方面存在局限性。将大型语言模型(LLMs)与XR整合引入了新的能力,但也带来了用户自主性、数据安全和伦理透明性方面的显著风险。
- 重要性: LLMs与XR的整合有潜力通过增强人类认知、感官和环境控制来彻底改变医疗、教育和职业培训等领域。然而,解决相关风险对于负责任的采用至关重要。
- 动机与相关工作: 先前研究探讨了XR在克服人类感官和认知局限方面的潜力,以及LLMs增强上下文理解的能力。然而,LLMs与XR的结合仍然研究不足,特别是在平衡赋能与社会技术风险方面。
解决方案
- 提出的方法: 提出一个LLM驱动的XR“超能力”及其相关风险的分类法,并制定设计指南以及未来研究议程以减轻这些风险。
- 创新点:
- 开发一个全面的分类法,将LLM驱动的XR“超能力”分为内部、外部和“读心术”能力。
- 识别并分析与这些“超能力”相关的风险,包括用户自主性、数据安全和伦理问题。
- 创建可操作的设计指南,以平衡赋能与风险缓解。
- 提出一个可扩展的框架,用于随着领域发展更新分类法。
- 程序与关键技术:
- 使用扎根理论文献综述方法对135篇文献进行了系统性综述。
- 通过迭代编码和优化开发了“超能力”和风险的分类法。
- 基于分类法提出设计指南,并将其映射到现有理论,如分布式认知理论和认知负荷理论。
结果
- 具体发现:
- 内部“超能力”包括认知负荷减少(23/56)、知识获取(17/56)和记忆增强(5/56)。
- 外部“超能力”涉及环境创建(11/22)、环境修改(10/22)和社交互动增强(33/135)。
- “读心术”能力包括基于视线的文本输入、身体动作解释和语义预测。
- 识别的风险包括思想和行为操控(例如,内部“超能力”中51/58)、跨现实安全漏洞(外部“超能力”中31/75)以及用户数据透明性问题(“读心术”能力中17/21)。
- 相较基线的优势: 分类法提供了一个结构化框架,用于理解LLM驱动的XR的能力和风险,填补了之前研究中仅关注XR或LLMs的孤立研究的空白。
- 实验/评估:
- 文献综述覆盖了576篇独特论文,筛选出135篇进行深入分析。
- 编码决策的评审员间一致性达到92%。
- 提出的指南已根据现有理论和新兴研究进行验证。
- 局限性与未来工作:
- 扎根编码的主观性限制了其在所有XR应用中的普适性。
- 缺乏关于LLM驱动XR认知影响的长期数据。
- 未来工作包括指南的实证验证、可扩展的审查流程开发,以及对用户长期影响的探索。
总结
本文提出了一个LLM驱动的XR“超能力”分类法,将其分为内部、外部和“读心术”能力,并识别了相关风险,如数据安全、用户自主性和伦理问题。作者提出设计指南以减轻这些风险,强调透明性、用户控制和恢复能力。研究基于对135篇文献的系统性综述,为未来研究和XR技术的负责任发展提供了基础。分类法和指南旨在平衡用户赋能与社会技术风险的缓解,确保LLM驱动XR系统的可持续和伦理采用。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 75%
从提示到临在:与生成式AI在VR中共创个性化情感避难所
IUI '26· 生成式AI(文本、图像、音乐、视频) +3
- 71%
GANzilla:在生成对抗网络中实现用户驱动的方向发现
UIST '22· 生成式AI(文本、图像、音乐、视频) +1
- 63%
虚拟现实中的用户入门:当前实践的调查
CHI '23· VR 中的社交与协作 +2
- 63%
AI增强的头脑风暴:研究LLM在团队创意生成中的应用
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 63%
生成式AI应用程序的设计原则
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 63%
偏好引导的提示优化用于文生图生成
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 63%
基于反事实回放和混合Wizard-of-Oz的多模态生成式AI实时代理原型设计
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 63%
与生成式AI合作:模型主导和人类主导交互在人机共创中的实验评估
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 63%
交互增强指令:建模人-GenAI协作中提示与交互的协同作用
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 63%
量化延迟:虚拟现实中人-智能体交互的会话分析方法
CHI '26· VR 中的社交与协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791307
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、沉浸感与临场感研究、VR 中的社交与协作
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文