SonicSieve:利用声学微结构为智能手机带来定向语音提取
作者
声学传感与音频处理噪声环境下的交互软件工程师与开发者UI/UX 设计师
文献标题
SonicSieve: Bringing Directional Speech Extraction to Smartphones Using Acoustic Microstructures
出版信息
- 主题领域: 使用仿生声学微结构在智能手机上实现方向性语音提取。
- 关键词: 方向性语音提取, 声学微结构, 智能手机, 实时处理, 神经网络, 空间音频, 波束形成, 麦克风阵列, 用户界面, 音频增强。
背景与问题
- 问题/挑战: 现有的方向性语音提取系统依赖于多通道麦克风阵列,但由于硬件限制,大多数智能手机无法兼容这些系统。智能手机通常只有两个麦克风,限制了其捕捉空间音频线索的能力。目前的方向性麦克风为固定方向,缺乏多方向分离能力。
- 意义: 使智能手机能够执行方向性语音提取,将在嘈杂环境中显著改善音频质量,惠及会议记录、远程会议和语音助手等应用。
- 动机与相关工作: 以往关于空间音频感知的研究主要集中在麦克风阵列或定制硬件上,这些方法与智能手机不兼容。系统如 Owlet 和 EarCase 引入了用于到达方向估计的声学微结构,但未解决方向性语音提取问题。神经波束形成器和统计算法在处理复杂空间线索时存在局限性。本文在这些工作的基础上,提出了一种基于仿生声学微结构的智能手机兼容解决方案。
解决方案
- 提出的方法: SonicSieve 系统结合仿生声学微结构和实时神经网络,实现智能手机上的方向性语音提取。
- 创新点:
- 开发了一种针对语音频率优化的紧凑型声学微结构,提供增强的空间多样性。
- 将微结构集成到标准有线耳机中,以实现智能手机兼容性。
- 实时神经网络支持多说话人场景的方向性语音提取。
- 创建了一个多样化环境下的真实世界数据集,用于训练和评估。
- 流程与关键技术:
- 设计并制造了一个直径为 20 mm 的微结构,包含六个战略性布置的孔,以最大化空间多样性。
- 使用内置麦克风和内联麦克风将微结构集成到智能手机中。
- 开发了一个利用双耳电平差和相位差的神经网络,用于实时处理。
- 在多个环境中收集真实世界数据集,用于系统的训练和评估。
结果
- 具体发现:
- 在单扇区方向性语音提取中实现了 5.0 dB 的 SI-SDR 改进,优于未使用微结构的基线(2.3 dB)。
- 在仅使用两个麦克风的情况下,性能与或优于五麦克风阵列,达到 4.4 dB 的 SI-SDR 改进。
- 实现了实时处理能力,在各种智能手机上的延迟为 4.5–7.2 ms。
- 用户研究结果显示,SonicSieve 的平均主观评分高于两麦克风阵列基线。
- 相较基线的优势:
- 超越了传统的两麦克风系统,并匹配或超过了五麦克风阵列的性能。
- 在多样化环境和智能手机几何结构中表现出强大的鲁棒性。
- 实验/评估:
- 在五种真实环境中评估,包含 45,000 个音频混合样本。
- 进行了“留一房间验证”和包含 44 名参与者的用户研究。
- 与传统波束形成和麦克风阵列系统进行了比较。
- 局限性与未来工作:
- 当前系统需要手动更新移动说话人的扇区。
- 限于预定义的方向性扇区,无法分离同一扇区内的多个说话人。
- 未来工作包括动态到达方向估计、更精细的空间分离,以及与设备原生设计的集成。
总结
SonicSieve 提出了一种通过结合仿生声学微结构和实时神经网络的创新方法,实现智能手机上的方向性语音提取。该系统在语音质量上实现了显著提升(最高 5.0 dB SI-SDR),并在仅使用两个麦克风的情况下匹配或超过了五麦克风阵列的性能。在多样化环境和用户研究中的评估证实了其鲁棒性和可用性。该系统兼容标准智能手机,支持会议记录和语音助手等应用。未来工作将致力于动态说话人跟踪和更精细的空间分辨率。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790376
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
声学传感与音频处理、噪声环境下的交互
work
职业/产业
软件工程师与开发者、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文