语义听力:用双耳可穿戴设备编程声学场景

听觉障碍者支持(字幕、手语、振动)生物传感器与生理监测医生、护士、临床医生运动员与健身爱好者辅助技术专家

文献标题

Semantic Hearing: Programming Acoustic Scenes with Binaural Hearables

文献信息

  • 主题领域: 音频处理与人机交互,涉及语义听觉和双耳设备的实时声音提取
  • 关键词: 双耳目标声音提取, 嵌入式计算, 噪声消除, 实时语义听觉, 人机交互, 随机神经网络, 空间音效, 深度学习

研究背景与问题

  • 问题或挑战:
    • 在真实环境中,用户可能想实时关注特定音频目标(如鸟鸣、救护车声)并屏蔽其它干扰(如交通噪声)。传统的噪声消除设备只能统一处理环境噪声,无法灵活选择允许或屏蔽的声音。同时,实现这一功能面临基于双耳输入的实时处理、高效保留空间音效以及模型对真实复杂情境的泛化能力不足的问题。
  • 重要性:
    • 语义听觉为耳戴设备带来了对环境音效场景的可编程化控制能力。这不仅可以提升用户的音频体验,还可应用于健康、娱乐及安全领域,比如清晰关注婴儿的哭声、警车鸣笛等。
  • 研究动机与相关工作:
    • 噪声消除技术已成熟,但仅能过滤所有环境声或简单透明化处理。近年来目标声音提取技术有了一定发展,但多集中于离线语音分离或单向通道模型,未广泛涵盖双耳设备实时使用场景的相关研究。

解决方案

  • 研究方法与解决方案:
    • 提出了首个针对双耳输入的目标声音提取神经网络架构,该架构在实时运行中能有效保留音效的空间线索。
    • 设计了改进版的Transformer网络,结合动态编程方法优化了处理效率,支持低端设备(如智能手机)实时运行。
    • 开发了一套数据生成与模型训练方法,通过合成数据涵盖不同的房间混响响应与头相关传递函数(HRTF),显著提升模型泛化能力。
  • 创新之处:
    • 首个双耳框架中联合处理左右耳通道而不是分离处理,降低了50%的计算成本。
    • 利用真实环境因素(混响、声音反射等)的合成数据训练方法,避免依赖硬件捕获且提升在新用户与新环境中的性能。
  • 主要实施步骤与技术:
    1. 设计适合实时需求的双耳声音提取网络架构,包括编码器与解码器模块。
    2. 实现动态流媒体推断,同时保持逻辑因果性。
    3. 通过Scaper工具动态合成含头相关传递函数的双耳混合数据。
    4. 利用多种音频类数据集与声音场景合成进行模型训练,提升模型对多种环境与目标音效的识别能力。

研究成果

  • 具体成果:
    • 模型在实际环境中对20种目标声音类型的提取平均信号质量改善[SNR]达到7.17 dB。
    • 系统具备实时性,在iPhone 11上处理10ms音频块的运行时间仅为6.56ms,满足实时播放需求。
    • 使用者可以通过调整设备屏蔽干扰声音,并显著提升目标声音的听觉体验。
  • 优势:
    • 相比传统噪声消除设备,该方案能够通过语义控制选择性听取目标声音,同时保留空间感知和声源方向。
    • 与现有声音提取方法相比,模型运行效率更高,泛化能力更好。
  • 实验或评估结果:
    • 在五个真实复杂环境中进行用户实验,模型准确保留用户感知的声源角度,方向预测误差50百分位为22.5°,90百分位为45°。
    • 用户倾向于通过语音用户界面操作目标声音选择,证明系统易用性及实用性。
  • 局限性与未来方向:
    • 数据不平衡问题:某些目标音效(如汽车鸣笛)训练样本较少,影响性能。
    • 对含类似特征的声音(如音乐与语音)分离较为困难,这需要改进网络架构或增加数据种类。
    • 当前系统硬件方面需要更简便的设备整合,例如支持噪声取消与播放功能的耳机硬件优化。
    • 长期来看,集成自定义硅芯片以降低设备功耗与延迟是潜在商业化方向。

总结与贡献

此项研究首次提出实时语义听觉的概念并实现原型系统,开创性地解决了双耳设备在真实场景下的音效选择性提取问题。通过公开数据集与代码,作者希望推进相关领域的进一步研发与应用。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/126683/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3586183.3606779
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
听觉障碍者支持(字幕、手语、振动)、生物传感器与生理监测
work
职业/产业
医生、护士、临床医生、运动员与健身爱好者、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文