噪声环境下可懂度优先
别名: 噪声中可懂度 · speech-in-noise TTS · 车内听清优先
概念解释
环境一旦有掩蔽,合成语音的第一目标改成可懂度,不是自然度。高速车上,引擎、胎噪和未关死的广播叠在一起,一套在录音棚里显得「亲切、带气声」的播报,到驾驶位上会把下一条出口名吃掉。这里的对象是系统嘴在噪声里还能否把词送进耳朵,不是麦克风在噪声里还能否听清用户——那是输入侧的事。人在吵的时候会自己改发音;工作室语料训出来的 TTS 往往还按安静风格在说。
机制
人说话碰到噪声会走 Lombard 一类适应:提高声强、让频谱更亮、略放慢、减少气声。棚内朗读没有这些变化,神经 TTS 还会保留气声起音、吱声和软起始——这些线索在 MOS 里加分,却正好落在胎噪和空调的低频掩蔽带里,而且本来就不承担词身份。噪声里的可懂度靠的是瞥见:掩蔽之上还剩多少共振峰碎片能拼出音段。亲密、气声重的音色把能量放在最容易被掩的地方;略扁、更靠前、能量更足的「清晰语音」风格牺牲一点像人,换的是瞥见次数。把车舱当客厅去追求自然度,是在用错误的声学预算买好听。
怎么研究
噪声中言语:把目标句叠到受控信噪比上,噪声用言语成形噪声、真实车舱录音或车站现场。因变量是关键词识别率或 言语接受阈(SRT:半数关键词正确时的信噪比),不是 MOS。对照「棚内自然」风格与「清晰语音」风格(略慢、更强、少气声)。语音传输指数(STI)可以作声学侧估计,但不能代替听人。
方法论上:耳机里叠加的噪声不等于座舱——空间、本车噪声和扬声器指向都不同。电台作为掩蔽是产品可控的,和胎噪不是一类。不要在安静 MOS 上选声音,再假设它在高速公路上「差不多」。
边界
安静室内的电话菜单,自然度可以和可懂度并列,不必一律改成广播腔。佩戴助听器的人往往还需要更多高频能量,不是单纯拧音量。主动降噪耳机把舱外掩蔽卸掉之后,这条优先序会松一截。同一对喇叭里正在放的导航提示和音乐是你能闪避的掩蔽:闪避做了,对音色的压力就小一档。完全听不清时人会去看屏幕——有屏是退路,不是把输出可懂度让出去的理由。
怎么落地
- 车载、车间、站台一体机:用加了现场噪声的关键词测验选音色和均衡,不要用安静 MOS 决胜。
- 提供清晰语音档:略降语速、提高响度、收掉气声;默认在检测到高噪声时切过去。
- 系统自己放的音乐、播客与提示抢喇叭时,提示开口就闪避,不要靠用户关媒体。
- 验证:真实提示在停着的车上开空调和一台收音机播放,让副驾写下出口编号、街道名或登机口。写不对,就还不是噪声下可懂度优先。