编织声音信息以支持实时听觉环境的理解:与聋人用户共同设计

语音可访问性听觉障碍者支持(字幕、手语、振动)通用设计与包容性设计语言治疗师与听觉学家辅助技术专家

研究背景与问题

  • 作者发现了哪些问题或挑战? 当前的人工智能(AI)声音识别系统能够协助聋人及听力受损者(DHH)获取声音信息,例如离散的声音源和语音转录。然而,这些系统通常具有预配置的输出,无法根据DHH用户不断变化的实时语境、目标和信息需求进行定制。这种静态设计难以满足用户在复杂音频环境中的动态需求并支持语义理解。

  • 为什么这个问题很重要? DHH用户需要借助声音意识技术来提高对环境的理解,从而支持日常的社交互动和任务执行。动态调整声音信息的显示以满足实时需求,不仅可以提高用户体验,还能加强DHH用户对环境的理解能力,促进无障碍技术的传播。

  • 研究动机与相关工作 过去的工作主要集中于声音分类、听觉场景理解以及自动语音识别等技术,但生成的信息通常是静态且预配置,缺乏与用户目标的语义关联。作者希望突破传统AI声音识别系统的局限,设计一种“意图驱动”的系统,从而根据用户动态需求编织声音信息并进行实时调控。

解决方案

  • 作者提出了哪些方法或解决方案? 作者提出了一种名为“SoundWeaver”的原型系统,其基于用户意图动态地编织来自不同AI模型的声音输出,并通过头戴式显示设备(HMD)呈现综合信息。该系统包括三种模式:Awareness(环境知觉)、Action(任务监控)和Social(社交互动),分别支持DHH用户的不同信息需求。

  • 该解决方案的创新之处是什么? SoundWeaver与传统声音识别系统的主要区别在于其“意图驱动”的设计。相比静态的视觉化输出,该系统能够根据用户的当前目标动态调整行为,支持语义上的实时感知和切换。此外,它通过多次协同设计环节,专注于用户个人环境和文化背景,避免过度侵入性的设计。

  • 实施步骤是什么?使用了哪些关键技术?

    1. 多阶段协同设计:作者通过三阶段研究,与一名听力受损用户(“Declan”)进行深入的协同设计,逐步完善系统。
    2. 多模态AI支持:集成声音分类、语音识别和声学场景理解(例如Audio Flamingo模型)技术,动态生成音频和语义信息。
    3. 头戴式显示设备实现:SoundWeaver运行在Apple Vision Pro设备上,用户可以通过简单的交互切换不同模式并调整信息显示。
    4. 模式设计
      • Awareness模式提供环境声音的整体感知,例如通过波形表示音量变化。
      • Action模式支持任务相关的声音监控,用户可以选择需要追踪的声音,例如微波炉结束的提示音。
      • Social模式通过语音转录和社交相关指示器(例如“音泡”显示)帮助用户进行社交互动。

研究成果

  • 取得了哪些具体成果? SoundWeaver通过三种模式精简了不同类型的声音信息,支持用户根据需要实时切换。此外,系统包含显著声音(例如紧急警报和姓名呼叫)的覆盖功能,无论当前模式如何,都能及时提醒用户。

  • 与现有解决方案相比,它有哪些优势? 相比现有系统的静态设计,SoundWeaver为用户提供了基于个人意图的动态信息调度,并显著优化了声音视觉化的设计以避免干扰或信息过载。同时,该系统融合了用户的文化背景和个性化需求,通过协同设计实现更贴合的用户体验。

  • 实验或评估结果是什么? 在两种真实环境(家庭和游戏店)中的部署和评估显示,SoundWeaver能够有效支持用户实现任务执行和社交互动。例如,通过动态切换模式,用户能够根据实时需求轻松转换信息显示。同时,系统还促成了新的社会互动动态,例如增强与朋友间的合作。

  • 局限性与未来方向

    1. 用户多样性限制:目前的研究仅基于Declan一人的深度参与,未来应扩大研究范围至更广泛的DHH群体以验证设计适用性。
    2. 硬件舒适度:由于目前设备较为笨重(例如Apple Vision Pro),用户长时间使用会产生疲劳,未来需要探索更易于使用的硬件形式。
    3. 隐性反馈设计:目前模式切换需要用户手动操作,未来可探索更智能化的意图推断技术以减少交互复杂度。
    4. 与用户社会动态的潜在冲突:系统设计需进一步审慎处理用户的现有社交关系,以避免潜在的侵入性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188590/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714268
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
语音可访问性、听觉障碍者支持(字幕、手语、振动)、通用设计与包容性设计
work
职业/产业
语言治疗师与听觉学家、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文