语义听力:用双耳可穿戴设备编程声学场景
作者
听觉障碍者支持(字幕、手语、振动)生物传感器与生理监测医生、护士、临床医生运动员与健身爱好者辅助技术专家
文献标题
Semantic Hearing: Programming Acoustic Scenes with Binaural Hearables
文献信息
- 主题领域: 音频处理与人机交互,涉及语义听觉和双耳设备的实时声音提取
- 关键词: 双耳目标声音提取, 嵌入式计算, 噪声消除, 实时语义听觉, 人机交互, 随机神经网络, 空间音效, 深度学习
研究背景与问题
- 问题或挑战:
- 在真实环境中,用户可能想实时关注特定音频目标(如鸟鸣、救护车声)并屏蔽其它干扰(如交通噪声)。传统的噪声消除设备只能统一处理环境噪声,无法灵活选择允许或屏蔽的声音。同时,实现这一功能面临基于双耳输入的实时处理、高效保留空间音效以及模型对真实复杂情境的泛化能力不足的问题。
- 重要性:
- 语义听觉为耳戴设备带来了对环境音效场景的可编程化控制能力。这不仅可以提升用户的音频体验,还可应用于健康、娱乐及安全领域,比如清晰关注婴儿的哭声、警车鸣笛等。
- 研究动机与相关工作:
- 噪声消除技术已成熟,但仅能过滤所有环境声或简单透明化处理。近年来目标声音提取技术有了一定发展,但多集中于离线语音分离或单向通道模型,未广泛涵盖双耳设备实时使用场景的相关研究。
解决方案
- 研究方法与解决方案:
- 提出了首个针对双耳输入的目标声音提取神经网络架构,该架构在实时运行中能有效保留音效的空间线索。
- 设计了改进版的Transformer网络,结合动态编程方法优化了处理效率,支持低端设备(如智能手机)实时运行。
- 开发了一套数据生成与模型训练方法,通过合成数据涵盖不同的房间混响响应与头相关传递函数(HRTF),显著提升模型泛化能力。
- 创新之处:
- 首个双耳框架中联合处理左右耳通道而不是分离处理,降低了50%的计算成本。
- 利用真实环境因素(混响、声音反射等)的合成数据训练方法,避免依赖硬件捕获且提升在新用户与新环境中的性能。
- 主要实施步骤与技术:
- 设计适合实时需求的双耳声音提取网络架构,包括编码器与解码器模块。
- 实现动态流媒体推断,同时保持逻辑因果性。
- 通过Scaper工具动态合成含头相关传递函数的双耳混合数据。
- 利用多种音频类数据集与声音场景合成进行模型训练,提升模型对多种环境与目标音效的识别能力。
研究成果
- 具体成果:
- 模型在实际环境中对20种目标声音类型的提取平均信号质量改善[SNR]达到7.17 dB。
- 系统具备实时性,在iPhone 11上处理10ms音频块的运行时间仅为6.56ms,满足实时播放需求。
- 使用者可以通过调整设备屏蔽干扰声音,并显著提升目标声音的听觉体验。
- 优势:
- 相比传统噪声消除设备,该方案能够通过语义控制选择性听取目标声音,同时保留空间感知和声源方向。
- 与现有声音提取方法相比,模型运行效率更高,泛化能力更好。
- 实验或评估结果:
- 在五个真实复杂环境中进行用户实验,模型准确保留用户感知的声源角度,方向预测误差50百分位为22.5°,90百分位为45°。
- 用户倾向于通过语音用户界面操作目标声音选择,证明系统易用性及实用性。
- 局限性与未来方向:
- 数据不平衡问题:某些目标音效(如汽车鸣笛)训练样本较少,影响性能。
- 对含类似特征的声音(如音乐与语音)分离较为困难,这需要改进网络架构或增加数据种类。
- 当前系统硬件方面需要更简便的设备整合,例如支持噪声取消与播放功能的耳机硬件优化。
- 长期来看,集成自定义硅芯片以降低设备功耗与延迟是潜在商业化方向。
总结与贡献
此项研究首次提出实时语义听觉的概念并实现原型系统,开创性地解决了双耳设备在真实场景下的音效选择性提取问题。通过公开数据集与代码,作者希望推进相关领域的进一步研发与应用。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 可穿戴设备如何实时提取目标声音并保留空间声效?分类: 可穿戴触觉与音频传感设备同类问题arrow_forward
- 现有的双耳声道处理方法如何改进以减少计算成本?分类: 可穿戴触觉与音频传感设备同类问题arrow_forward
- 通过动态数据合成如何提升模型对复杂音频环境的泛化能力?分类: 可穿戴触觉与音频传感设备同类问题arrow_forward
lightbulb
现实痛点
1- 用户无法灵活选择听取目标声音(如婴儿哭声)并有效屏蔽干扰。分类: 可穿戴触觉与音频传感设备同类问题arrow_forward
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3586183.3606779
一眼看懂
fact_check论文快照
dataset
来源
UIST
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
听觉障碍者支持(字幕、手语、振动)、生物传感器与生理监测
work
职业/产业
医生、护士、临床医生、运动员与健身爱好者、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文