C7.05.1SNR-limited speech usability设计研究
信噪比直接决定识别可用性
别名: 信噪比 · SNR · 远场识别 · 可用性门限
概念解释
信噪比(signal-to-noise ratio, SNR)是目标语音能量相对背景的尺度。降到某一带之后,识别不再是“准一点或差一点”,而是整条语音通道失去可用性:唤醒不稳、命令无法执行、听写不可用。噪声环境里首先要问的是当前 SNR 还够不够当作输入,而不是先问用了哪种降噪算法。
机制
声学模型在训练 SNR 附近学到音素边界。噪声抬高基底后,辅音的频谱细节被埋掉,元音的共振峰被填平,帧级后验变平,语言模型再怎么偏置也填不回已经丢掉的对立。远场还有距离带来的能量下降,等效 SNR 比近场更差。设备侧 AGC 会把噪声和语音一起放大,看起来音量够了,比例并没有变好。可用性因此呈门限:高于门限,错误主要是替换;低于门限,删除和乱插入爆炸,意图也无法恢复。这与“噪声种类不同、干扰机制不同”是两层:这里只关心能量比是否还撑得起通道。
怎么研究
在受控噪声上按 SNR 步进测量唤醒成功率、命令完成率和听写 WER,找到可用性跌破产品门槛的区间。噪声要用稳态宽带作基线,再换真实场景复验。自变量包括说话距离和麦克风类型。报告时写明用的是未处理波形的 SNR 还是增强后的 SNR,两者不可混。实验室用白噪声会得到过干净的门限,厨房和车内的频谱形状会移动那条门。
边界
佩戴式近讲麦克风可以提高 SNR,同一房间里的免提音箱则不能。唇读、按键或触控在低 SNR 下仍然可用,说明“环境吵”不等于“无法交互”,只等于这条声学通道失效。极高 SNR 的消声室结果不能外推到咖啡馆。把所有失败都归到 SNR,会忽略多人抢话和回声消除失败这些不是能量比能概括的问题。
怎么落地
- 为关键语音任务规定最低可用 SNR,并在车内、厨房、街道上实测,而不是只在办公室达标。
- SNR 跌破门限时,把语音入口降级或关掉,并立即露出非语音完成方式,不要继续装成还能听。
- 日志同时记估计 SNR 与任务成败,用来核对门限,而不是只看平均识别率。