C7.12.3Noise suppression versus speech naturalness设计研究
噪声抑制算法在提升识别率的同时可能损失语音的自然音质
别名: 降噪伪影 · musical noise · 语音失真 · enhancement artifacts
概念解释
噪声抑制把估计出的噪声从混合信号里挖掉,往往能提高后端 ASR 的字正确率,同时把语音变得发闷、带音乐噪声(musical noise)或切断辅音。对人耳,增强后的声音可能更难懂或更假;对模型,特征却更像训练集。识别率与自然音质不是同一指标,可以朝相反方向走。
机制
谱减和掩蔽会在时间-频率格子上衰减。估计偏大会切掉弱辅音和高频谐波,音色变闷;估计偏差则留下残余,再被非线性处理成音调状的音乐噪声。神经网络增强若为 ASR 的特征目标训练,会牺牲波形可听性;若为听感训练,WER 不一定最好。双耳线索和空间感也会被单通道抑制毁掉,这在通话里比在 ASR 里更明显。把增强后的音频给人听和给模型听,是两条评价链。产品若把同一路增强既送识别又送扬声器回放(或给客服监听),音质损失会被用户直接听到。
怎么研究
在同一噪声上对比:无增强、为 ASR 优化的增强、为听感优化的增强。因变量并列 WER、PESQ/DNSMOS 一类听感分数、以及主观自然度。做 ASR 时应用增强后的特征;做听感时用波形。报告抑制过猛导致的删除上升。不要只用 WER 宣布增强成功。
边界
只进 ASR、从不给人类听的前端,自然音质可以让路给识别,只要不引入伤害模型的伪影。通话和会议回放则不能。过强抑制在低 SNR 会把语音一并挖空,WER 反而变差。骨传导和喉麦的音色本来就不自然,再套消费级听感指标会误导。
怎么落地
- 进识别和进扬声器的增强分开调:识别前端可以更狠,回放链路要保可懂和自然。
- 上线增强时同时看 WER 和听感;听感崩溃而 WER 微升,对通话类产品仍是失败。
- 提供可关的抑制档位,并在“太闷、字被切”的投诉里回查掩蔽是否过强,而不是再加一级抑制。