编织声音信息以支持实时听觉环境的理解:与聋人用户共同设计
作者
研究背景与问题
-
作者发现了哪些问题或挑战? 当前的人工智能(AI)声音识别系统能够协助聋人及听力受损者(DHH)获取声音信息,例如离散的声音源和语音转录。然而,这些系统通常具有预配置的输出,无法根据DHH用户不断变化的实时语境、目标和信息需求进行定制。这种静态设计难以满足用户在复杂音频环境中的动态需求并支持语义理解。
-
为什么这个问题很重要? DHH用户需要借助声音意识技术来提高对环境的理解,从而支持日常的社交互动和任务执行。动态调整声音信息的显示以满足实时需求,不仅可以提高用户体验,还能加强DHH用户对环境的理解能力,促进无障碍技术的传播。
-
研究动机与相关工作 过去的工作主要集中于声音分类、听觉场景理解以及自动语音识别等技术,但生成的信息通常是静态且预配置,缺乏与用户目标的语义关联。作者希望突破传统AI声音识别系统的局限,设计一种“意图驱动”的系统,从而根据用户动态需求编织声音信息并进行实时调控。
解决方案
-
作者提出了哪些方法或解决方案? 作者提出了一种名为“SoundWeaver”的原型系统,其基于用户意图动态地编织来自不同AI模型的声音输出,并通过头戴式显示设备(HMD)呈现综合信息。该系统包括三种模式:Awareness(环境知觉)、Action(任务监控)和Social(社交互动),分别支持DHH用户的不同信息需求。
-
该解决方案的创新之处是什么? SoundWeaver与传统声音识别系统的主要区别在于其“意图驱动”的设计。相比静态的视觉化输出,该系统能够根据用户的当前目标动态调整行为,支持语义上的实时感知和切换。此外,它通过多次协同设计环节,专注于用户个人环境和文化背景,避免过度侵入性的设计。
-
实施步骤是什么?使用了哪些关键技术?
- 多阶段协同设计:作者通过三阶段研究,与一名听力受损用户(“Declan”)进行深入的协同设计,逐步完善系统。
- 多模态AI支持:集成声音分类、语音识别和声学场景理解(例如Audio Flamingo模型)技术,动态生成音频和语义信息。
- 头戴式显示设备实现:SoundWeaver运行在Apple Vision Pro设备上,用户可以通过简单的交互切换不同模式并调整信息显示。
- 模式设计:
- Awareness模式提供环境声音的整体感知,例如通过波形表示音量变化。
- Action模式支持任务相关的声音监控,用户可以选择需要追踪的声音,例如微波炉结束的提示音。
- Social模式通过语音转录和社交相关指示器(例如“音泡”显示)帮助用户进行社交互动。
研究成果
-
取得了哪些具体成果? SoundWeaver通过三种模式精简了不同类型的声音信息,支持用户根据需要实时切换。此外,系统包含显著声音(例如紧急警报和姓名呼叫)的覆盖功能,无论当前模式如何,都能及时提醒用户。
-
与现有解决方案相比,它有哪些优势? 相比现有系统的静态设计,SoundWeaver为用户提供了基于个人意图的动态信息调度,并显著优化了声音视觉化的设计以避免干扰或信息过载。同时,该系统融合了用户的文化背景和个性化需求,通过协同设计实现更贴合的用户体验。
-
实验或评估结果是什么? 在两种真实环境(家庭和游戏店)中的部署和评估显示,SoundWeaver能够有效支持用户实现任务执行和社交互动。例如,通过动态切换模式,用户能够根据实时需求轻松转换信息显示。同时,系统还促成了新的社会互动动态,例如增强与朋友间的合作。
-
局限性与未来方向
- 用户多样性限制:目前的研究仅基于Declan一人的深度参与,未来应扩大研究范围至更广泛的DHH群体以验证设计适用性。
- 硬件舒适度:由于目前设备较为笨重(例如Apple Vision Pro),用户长时间使用会产生疲劳,未来需要探索更易于使用的硬件形式。
- 隐性反馈设计:目前模式切换需要用户手动操作,未来可探索更智能化的意图推断技术以减少交互复杂度。
- 与用户社会动态的潜在冲突:系统设计需进一步审慎处理用户的现有社交关系,以避免潜在的侵入性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 如何通过动态调整声音信息显示满足听障用户的实时情境和目标需求?分类: 听障沟通与手语识别同类问题arrow_forward
- 听障用户在环境感知、任务监控和社交互动方面对声音信息的需求有何不同?分类: 听障沟通与手语识别同类问题arrow_forward
- 意图驱动的声音识别系统能否提升听障用户对环境的语义理解?分类: 听障沟通与手语识别同类问题arrow_forward
现实痛点
1- 听障用户难以快速获取动态声音信息满足各类情境需求。分类: 听障沟通与手语识别同类问题arrow_forward
- 100%
皇室字幕:从聋人和重听个体的角度探索情感字幕的设计空间
CHI '24· 语音可访问性 +2
- 67%
不同阅读水平的聋人或重听用户对不完美字幕工具的评估方法
CHI '18· 语音可访问性 +1
- 67%
评估具有不同读写水平的聋人和重听成人自动简化文本流利度的方法
CHI '22· 语音可访问性 +2
- 67%
字幕中语音韵律和情感的可视化:为聋人和重听用户提供无障碍服务
CHI '23· 语音可访问性 +2
- 67%
可见的细微差别:为聋人和重听人士可视化副语言语音线索的字幕系统
CHI '23· 语音可访问性 +2
- 67%
电视直播中用户如何体验字幕:质量指标仍然是一个挑战
CHI '24· 语音可访问性 +2
- 67%
理解之声——与失语症患者共处的无障碍音频媒体播放器实地部署研究
CHI '26· 语音可访问性 +2
- 67%
Vid2Coach:将教学视频转换为任务助手
UIST '25· 语音可访问性 +2
- 60%
面向带非手动标记的AI驱动的手语生成
CHI '25· 语音可访问性 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)