自然度与可懂度是两个指标
别名: MOS与可懂度 · 合成语音质量 · mean opinion score
概念解释
合成语音的自然度(naturalness)问的是「听起来像不像人」;可懂度(intelligibility)问的是「词能不能被听写出来」。银行电话菜单用一套很暖的神经音色念「请输入卡号后四位」,评听人会给高分,同一段里四个数字却被听成别的。前者常用 ITU-T 那类平均主观意见分(MOS, mean opinion score)的绝对等级评分来量;后者要靠听写、关键词识别或押韵最小对立体。两个分数描述同一条波形上的两件不同的事,不能互相替代。
机制
MOS 评听走的是整体印象:音色是否干净、气息是否像人、连接是否平滑。可懂度走的是音系与词汇恢复:辅音部位、元音对比、在弱读音节上还能否抓住词。神经合成可以靠频谱包络和基频轨迹把「像人」做到很高,同时把非重读音节的部位特征抹平——听感变好,辨词变差。反过来,早期共振峰合成听着像机器,音段对比却更硬,听写正确率可以更高。评听人在安静耳机里打的「好听」,并不经过那条辨词通路。把 MOS 当成「用户听懂了」的代理,是在用审美分数回答识别问题。
怎么研究
同一批合成样本上并行两套测验。自然度用 ITU-T P.800 的绝对等级评分(ACR),合成语音也可走 P.85 那套面向 TTS 的听音程序;可懂度用语义不可预测句(SUS)听写、诊断押韵测验(DRT)或关键词识别。自变量是引擎或声码器、语速、是否经电话带宽。因变量是 MOS(1–5)与词/关键词正确率,分开报告,不要合成一个「质量分」。
方法论上:安静实验室、高保真耳机上的 MOS 会抬高「悦耳」;同一批人在安静里做的听写又会漏掉现场失败。评听人若看到文本再听,测到的不是可懂度。不要用「二者高度相关,说一个就等于说了另一个」这类无出处的定论——两条轴在神经 TTS 上经常分叉,这正是要分开测的理由。
边界
品牌第一印象、人格塑造,自然度本身就是产品主张,不必向可懂度投降。涉及金额、账户、不可逆确认时,可懂度优先,音色平一点可以接受。呼叫中心质检员和普通用户打的 MOS 不可互换。耳机 MOS 不能直接搬到大厅喇叭或车载免提。完全无意义的音节串会压低可懂度、却不一定压低「好听」,两类语料不能混着解释。
怎么落地
- 验收同一套提示语时同时交两份数:MOS 面板,以及卡号末四位、金额、确认动词的听写正确率。
- 音色「更好听」但数字听写下降,就还没通过,不要用自然度涨幅去盖可懂度跌幅。
- 评测集拆开:寒暄、引导句一组;账号、金额、专名一组。只报整句正确率会把载荷词淹在高频词里。
- 验证:二十条真实提示,一半人打 MOS,一半人听完立刻写下关键载荷。MOS 升、听写降,说明优化走错了轴。