RAVEN:盲人和低视力人士虚拟环境的实时无障碍访问
语音可访问性沉浸感与临场感研究生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作可解释人工智能(XAI)医生、护士、临床医生UI/UX 设计师HCI 研究员
文献标题
RAVEN: Realtime Accessibility in Virtual ENvironments for Blind and Low-Vision People
出版信息
- 主题领域: 针对盲人和低视力用户的虚拟3D环境可访问性。
- 关键词: 可访问性, 虚拟环境, 盲人和低视力用户, 生成式人工智能, 自然语言交互, 运行时修改, 语义场景图, 对话式编程。
背景与问题
- 问题/挑战: 现有虚拟3D环境的可访问性工具是静态的,由开发者驱动,缺乏对动态、用户特定适配的支持。这些工具通常学习曲线陡峭,无法满足盲人和低视力(BLV)用户的细致需求。
- 重要性: 随着3D环境在游戏、教育和社交互动中变得不可或缺,确保公平访问至关重要。动态、用户驱动的解决方案可以赋能BLV用户,扩大他们的参与度。
- 动机与相关工作: 之前的研究探索了听觉和触觉反馈、视觉增强以及游戏中的静态可访问性设置。然而,这些方法在灵活性和个性化方面存在局限性。生成式人工智能和大型语言模型(LLMs)的进步提供了对话式运行时场景修改的机会,这在可访问性领域尚未被充分探索。
解决方案
- 提出的方法: RAVEN,一个基于生成式人工智能的系统,使BLV用户能够通过自然语言实时查询和修改3D虚拟环境。
- 创新点:
- 将LLMs与语义场景数据集成,用于运行时的可访问性修改。
- 引入自语音界面以支持自然语言交互。
- 开发了增强可访问性的语义场景图以提供上下文支持。
- 实施了提示工程策略以减少幻觉并提高可靠性。
- 流程与关键技术:
- 用户通过自然语言提示发出场景查询或修改请求。
- 系统检索语义场景数据,构建包含可访问性和错误预防指令的提示,并使用GROMIT生成Unity代码以进行修改。
- 修改实时执行,并向用户提供语音反馈。
- 基于试点研究进行了迭代优化,包括移除键盘快捷键、添加以自我为中心的空间描述以及减少幻觉。
结果
- 具体发现:
- 用户提示的成功执行率为75.3%,平均响应时间为3.1秒。
- 系统可用性评分较高(SUS得分:79.7),参与者认为系统直观(M=4.3/5)且赋能感强。
- 开发者对系统的学习性(M=4.7/5)和可用性(M=4.3/5)评价积极。
- 相较基线的优势:
- 与静态、开发者定义的工具不同,RAVEN支持动态、用户驱动的修改,能够满足个性化需求。
- 同时支持查询和运行时修改,解决了更广泛的可访问性挑战。
- 实验/评估:
- 对8名BLV参与者进行了用户研究,涵盖三个场景(引导式教程、任务驱动探索、开放式探索),以评估可用性和交互策略。
- 对6名Unity开发者进行了初步开发者研究,以评估集成难度和可扩展性。
- 局限性与未来工作:
- 不可忽视的错误率(22%的提示执行失败)以及对同一LLM进行生成和验证的依赖。
- 对对象可供性理解有限,限制了功能性交互。
- 样本量小且研究环境受控;需要在商业游戏中的实际部署。
- 未来工作包括改进错误预防、自动化元数据生成以及支持更丰富的语义建模。
总结
RAVEN提出了一种针对虚拟3D环境可访问性的创新方法,使BLV用户能够通过自然语言实时查询和修改场景。该系统利用生成式人工智能、语义场景图和提示工程策略,提供动态、用户驱动的可访问性。对BLV参与者和Unity开发者的评估显示了其可用性、灵活性和赋能潜力,同时也揭示了可靠性和可扩展性方面的挑战。未来在错误预防、元数据自动化和实际部署方面的进步将是实现生成式可访问性系统全部潜力的关键。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791616
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
语音可访问性、沉浸感与临场感研究、生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
医生、护士、临床医生、UI/UX 设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文