超越描述:一种为盲人和低视力用户生成景观音频的Scene2Audio框架

音频无障碍(字幕、手语、振动)情绪感知可穿戴设备视觉障碍者技术(屏幕阅读器、触觉图形、盲文)语言治疗师与听觉学家老年护理人员家庭照顾者(Caregiver)

文献标题

Beyond Descriptions: A Generative Scene2Audio Framework for Blind and Low-Vision Users to Experience Vista Landscapes

出版信息

  • 主题领域: 面向盲人和低视力用户的辅助技术,专注于听觉场景表示。
  • 关键词: 场景声音化、生成音频、辅助技术、盲人和低视力、听觉场景分析、心理声学、用户体验、认知负荷、可访问性、远景空间。

背景与问题

  • 问题/挑战: 当前针对盲人和低视力用户的辅助技术主要依赖于语言描述,这种方式具有交易性,增加了认知负荷,并且无法唤起视觉体验的审美愉悦感。现有的生成模型难以有效捕捉并声音化包含多个对象的复杂场景。
  • 重要性: 提升盲人和低视力用户对远景空间的体验对于休闲、情感健康和认知参与至关重要。解决视觉与听觉场景感知之间的差距可以改善可访问性和生活质量。
  • 动机与相关工作: 先前研究表明,非语言音频能够增强故事讲述和媒体中的沉浸感和理解力。然而,现有的辅助工具仅限于图像到文本到语音框架,缺乏互动性和可扩展性。用于音频合成的生成模型通常在场景级别的组合中表现不佳,尤其是在复杂环境中。

解决方案

  • 提出的方法: Scene2Audio框架,通过结合人工智能驱动的对象声音化、心理声学原理和听觉场景分析,为远景空间生成非语言音景。
  • 创新点:
    1. 引入两步流程:显著对象识别和音频场景组合。
    2. 将心理声学与拟音音效合成相结合,生成真实且沉浸的听觉场景。
    3. 通过实验室和实际环境研究对盲人和低视力参与者进行验证,证明生态效度。
  • 流程与关键技术:
    1. 显著对象识别: 使用GPT-4识别场景中的发声对象,并生成名词-动词动作短语(例如,“树叶沙沙作响”)。
    2. 音频场景组合: 区分离散和连续声音,减少重复的离散事件,并通过加权混合对声音进行分层(前景:0.8,背景:0.2)。
    3. 通过控制实验室研究和实际应用部署对盲人和低视力用户进行评估。

结果

  • 具体发现:
    • Scene2Audio实现了平均图像识别准确率62.4%,优于基线方法如Im2wav(17.3%)和Im2text2audio(29.6%)。
    • 在实验室研究中,叠加音频(语音+非语言声音)是最受欢迎的模式,在理解力(6.11 ± 0.53)、沉浸感(5.03 ± 1.00)和认知负荷(2.04 ± 1.01)方面得分最高。
    • 在实际应用中,详细模式(Overlay-Concat)因其清晰度(92%)和愉悦度(88%)而受到偏爱。
  • 相较基线方法的优势:
    • Scene2Audio在捕捉复杂场景方面优于Im2wav和Im2text2audio,尤其是在自然环境中。
    • 在信心(5.48 ± 1.15)和愉悦度(5.14 ± 1.24)评分上高于基线方法。
  • 实验/评估:
    • 对11名盲人和低视力参与者进行实验室研究,评估四种音频反馈策略(仅语音、仅音频、叠加、叠加-串联)在八个远景场景中的表现。
    • 对7名盲人和低视力参与者进行为期一周的实际环境研究,通过移动应用收集77张图像的反馈。
    • 对21名视力正常参与者进行听力测试,比较Scene2Audio与基线方法。
  • 局限性与未来工作:
    • 盲人和低视力参与者样本量较小,限制了研究结果的普适性。
    • 控制离散声音事件和解决生成模型中的幻觉问题存在挑战。
    • 实际部署问题包括延迟、缺乏空间化以及需要上下文感知模式。
    • 未来工作包括集成空间音频、减少延迟以及改进生成模型的控制能力。

总结

Scene2Audio框架通过结合心理声学和听觉场景分析生成非语言音景,为盲人和低视力用户弥合视觉与听觉场景感知之间的差距。该框架在可理解性和用户偏好方面显著优于基线方法,尤其是在自然场景中。实验室和实际环境研究表明,该框架具有提升远景空间休闲和认知参与的潜力。尽管在可扩展性、延迟和实际部署方面仍存在挑战,但该研究为辅助技术中的可访问性和沉浸式听觉体验奠定了基础。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223150/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791655
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
音频无障碍(字幕、手语、振动)、情绪感知可穿戴设备、视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
work
职业/产业
语言治疗师与听觉学家、老年护理人员、家庭照顾者(Caregiver)
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文