信噪比而非绝对噪声水平,决定语音与提示音能否被听清
别名: 信噪比 · SNR · 可懂度 · speech-to-noise ratio
概念解释
一段语音或一声提示音能不能被听清,取决于它比背景噪声高出多少分贝——这个差值叫信噪比(signal-to-noise ratio, SNR)。60 分贝的说话声在 50 分贝的安静办公室里(SNR 为 10 dB)很容易听清;同样 60 分贝的说话声在 75 分贝的地铁车厢里(SNR 为 −15 dB)几乎完全被淹没。噪声本身是 50 分贝还是 75 分贝并不直接决定可懂度,声音相对噪声高出多少才决定。
这一点容易被想反:直觉上会觉得"越安静的环境声音越容易听清、越吵的环境越难听清",把注意力放在环境噪声的绝对量级上。但真正的变量是信号和噪声两者的差,只报告分贝数而不比较信噪比,等于没有回答"听得清吗"这个问题。
机制
人耳判断"有没有一个声音",依赖的是这个声音在某个频段内产生的能量是否超出背景噪声在同一频段的能量足够多,而不是这个声音本身响不响。当信号能量与噪声能量的差距小到某个阈值以下,噪声的持续能量会把信号的起伏盖过去,听觉系统检测不到信号存在过;这个差距越大,信号的边缘、包络与频谱细节就越完整地被保留下来,可懂度随之上升。语音可懂度对信噪比尤其敏感,因为语音的语义信息主要靠辅音携带,而辅音本身能量低、频率偏高,正是最容易被噪声掩盖的部分——同样的信噪比下降,先丢失的是能不能分清"她"和"他",而不是能不能感觉到有人在说话。
怎么研究
标准做法是在受控噪声背景下呈现语音材料(词表、句子或数字串),系统地改变信号电平或噪声电平以操纵信噪比,测出被试达到某个正确识别率(常取 50%)所需的信噪比,这个值叫言语接收阈(speech reception threshold, SRT)。自变量是信噪比(有时进一步拆成信号电平与噪声电平两个独立变量,因为二者对可懂度的贡献并不完全对称);因变量是词/音节的正确识别率或 SRT 本身。
这类范式常被拿来给某个产品的语音交互或提示音设计定量一个"在多吵的环境下还能用"的边界,而不是笼统地说"够响"。
方法论上要注意:实验室噪声通常是稳态的粉红噪声或多人语音噪声,频谱平稳;真实环境噪声常常是间歇性、非稳态的(一阵警笛、一次关门声),信噪比在真实场景里是随时间剧烈波动的量,实验室测出的单一 SRT 数值只是一个平均意义上的参考点。
边界
- 信噪比只解释能不能听清这一层;即便信噪比达标,语速过快、口音陌生、术语生僻仍会独立拉低可懂度,这些是语言层面而非信号层面的限制。
- 噪声与信号的频谱重叠程度同样重要:同样的整体信噪比数值,如果噪声能量集中在语音的关键频段(约 500 Hz–4 kHz),可懂度损失会远大于噪声能量集中在语音频段之外的情况;单看总噪声分贝数或总信噪比数字会掩盖这个差异。
- 实验室测得的 SRT 是在被试专心配合、噪声稳态的条件下得出的,不能直接当作真实产品在非稳态噪声场景下的可用性下限,只能作为设计留白的参考起点。
怎么落地
- 给语音提示、警报音或语音交互设计音量策略时,不要以"固定分贝数"为目标,而要以"比目标场景的典型环境噪声高出一个可懂度所需的余量"为目标——先测场景噪声,再定输出电平。
- 提示音的频谱尽量避开目标环境噪声集中的频段,即使总信噪比数字相同,频谱错开也能显著提升实际可懂度。
- 验证办法:在目标场景(而不是安静的测试间)录制真实环境噪声,用这段噪声回放叠加待测的语音或提示音,请没有预期的听众判断能否听清、听清多少,用真实场景信噪比而不是实验室固定噪声去检验设计。
延伸
- 同组:A3.09.2 噪声场景下语音输入与输出同时退化 · A3.09.3 安静场景下声音输出的社交成本 · A3.09.4 达到可懂度所需的信噪比因内容类型与熟悉度而不同 · A3.09.5 噪声基线随场景剧烈变化,固定音量设置无法适应所有场景 · A3.09.6 主动降噪改变的是环境声输入,不改变设备本身输出的响度设定
- 相邻:A3.04 听觉掩蔽 · A3.02 响度感知与等响曲线 · A3.07 警报声的可辨识性
- 站内检索:
signal-to-noise ratio·speech reception threshold·speech intelligibility·masking