一看即听:噪声样本中的目标语音识别

荣誉提名
振动反馈与皮肤刺激眼动追踪与注视交互语音可访问性医生、护士、临床医生语言治疗师与听觉学家社会工作者

文献标题

Look Once to Hear: Target Speech Hearing with Noisy Examples

文献信息

  • 主题领域: 人机交互、机器学习,智能可穿戴设备
  • 关键词: 目标语音听觉, 噪声处理, 智能耳戴设备, 实时信号处理, 深度学习, 语音分离, 嵌入式系统, 空间音频

研究背景与问题

  • 发现的问题或挑战:

    • 在嘈杂环境中,人类可以专注于目标讲话者的语音,但现有的降噪耳机无法根据目标讲话者的语音特征选择性播放特定语音。
    • 常用的目标语音分离模型需要目标讲话者的纯净音频样本作为输入,但真实环境中通常无法获得这样的样本。
    • 用户界面设计也存在问题,例如如何方便地获取目标语音的注册数据。
  • 重要性:

    • 在嘈杂环境中准确提取目标语音对日常沟通、增强听觉体验以及听力辅助设备优化具有重要意义。这项技术不仅能够改善日常生活中的听觉体验,还可以进一步推动智能可穿戴设备的发展。
  • 研究动机:

    • 开发一种能够在真实世界的嘈杂环境中有效运作的智能可穿戴设备,通过仅需几秒钟的服务来完成目标讲话者的注册。
    • 融合深度学习和实时信号处理技术以优化设备的性能,使其能够轻松适应各种移动和多路径场景。

解决方案

  • 提出的方法或解决方案:

    • 提出了一种“目标语音听觉”系统,该系统使用两个模块完成目标语音分离任务:
      1. 噪声样本注册模块: 用户通过短暂凝视目标讲话者(1-4秒)产生复杂信号,用于生成讲话者特征嵌入。
      2. 实时目标语音分离模块: 嵌入式系统运行优化后的神经网络,以实时分离目标语音并移除干扰声音。
  • 创新之处:

    • 无需纯净语音样本即可完成目标讲话者注册。
    • 优化了神经网络架构,减少运行时的延迟,使系统能在嵌入式设备上实时运行。
    • 通过设计适配真实世界场景的训练机制,使模型能够在真实环境中(包括用户动态移动、室内外嘈杂等场景)有效工作。
  • 实施步骤与关键技术:

    1. 噪声注册接口:
      • 提出了两种方法来生成目标讲话者嵌入: 基于波束形成的估算法,以及知识蒸馏估算法。
      • 注册语音被捕捉为双耳录音,利用语音特征模型生成目标讲话者嵌入。
    2. 实时目标语音分离系统:
      • 使用改进的神经网络(如TFGridNet)实现目标语音分离,结合多种技术优化推断时间以满足实时性要求。
      • 缓存中间数据以减少计算冗余,改进模型在嵌入式平台上的优化表现。
    3. 模型训练方法:
      • 使用合成数据集对模型进行训练,同时引入BRIR(双耳室内响应)特性以适应真实场景中的多路径和头部相关传输函数。
      • 通过扩展训练考虑移动源和实时误差,增强模型的鲁棒性。

研究成果

  • 具体成果:

    • 在真实场景中,使用噪声注册数据时语音信号质量提高了平均 7.01 dB,与使用纯净数据相比性能仅下降 0.4 dB。
    • 系统能够在嵌入式设备(如 Orange Pi 5B)上以平均 6.24 毫秒的时间处理 8 毫秒的音频块,总延迟仅为 18.24 毫秒。
    • 用户研究显示该系统能够在室内和室外多路径环境下对目标讲话者进行高效分离,且呈现了显著用户满意度。
  • 与现有解决方案相比的优势:

    • 其他系统通常需要纯净语音注册,而该系统使用噪声样本完成相同任务,方便且用户友好。
    • 与传统定向听觉系统相比,无需持续跟踪讲话者方向,适合用户自由移动。
    • 使用优化后的模型在嵌入系统中实时运行,实现低功耗高效性能。
  • 实验与评估结果:

    • 测试表明知识蒸馏网络优于波束形成法,在噪声注册数据条件下表现更佳。
    • 在用户真实场景中的调查中获得了78%以上的参与者高度评价,且学习系统适应用户快速方向变化。
  • 局限性与未来方向:

    • 系统目前仅支持单目标语音提取,未来可扩展到多目标语音场景。
    • 未解决目标讲话者与干扰者声音高度相似的情况下的分离问题,这需要更强大的嵌入模型和更多注册数据。
    • 设备原型基于现有耳机和嵌入式设备,未来研究可探索更紧凑和符合社会接受度的设计(如无线耳塞形态)。
    • 应进一步优化设备并整合到更高级的主动降噪硬件中。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/147319/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642057
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
荣誉提名
group
作者
5 位作者
sell
研究子方向
振动反馈与皮肤刺激、眼动追踪与注视交互、语音可访问性
work
职业/产业
医生、护士、临床医生、语言治疗师与听觉学家、社会工作者
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文