韵律错误比音色平淡更妨碍理解
别名: 韵律错误 · misplaced prominence · 重音放错比嗓音干更糟
概念解释
听懂一句合成语音,韵律(prosody)放对,比嗓音是否好听更要紧。运动手表播「两百米后左转」,核重音落在「米」而不是「左」,人会去等距离,而不是准备转向。同一套音段,音色干一点但短语边界和焦点还在,理解往往仍在;音色很润、音高重音却落在错的成分上,解析会走错附件。这里比的是两条质量轴:平淡但结构对,对上好听但结构错。不是在讲重音本身能把句意翻成另一句——那是后头语速与韵律里的事。
机制
词身份靠频谱线索,也靠听者对突显位置的预期。音高重音和时长告诉人:哪个成分是焦点、修饰语贴哪一边、词边界在哪。神经音色可以把声道模仿得很像,却把核重音按「句末最重」的默认往尾巴一放,听者就把尾巴当成新信息。单调但切分正确的声音仍然交出词边界和默认焦点;错的韵律是把消息的结构写错了。MOS 喜欢前者的反面:润的音色加分,错的焦点不一定被打进自然度里,因为它听着仍「像人在说」。理解题才会把它抓住。
怎么研究
对同一条 TTS 做两种损伤,比较理解,不比 MOS。一种:声码器或频谱抹平,保留原来的音高和时长;另一种:保留原来的音色,打乱或挪走音高重音。材料用附件歧义句、焦点敏感句(「左转」对「下下个灯」)。因变量是理解选择题——谁做了什么、该执行哪一步——不是好听分数。
听者常会把频谱损伤说成「难听但清楚」,把错重音说成「好听但我没抓住谁对谁」。实验室若让人边看文本边听,附件在纸上已经解了,测不到韵律。
边界
声调语言里,音高既管词身份也管后词汇焦点,错韵律可能先把词毁掉,不只是焦点。品牌歌、提示音效,音色就是产品,这条比较不适用。高度程式化的短句(「请稍候」)扛得住坏韵律。信息性播报——导航、医嘱、选项推荐——才是这条的主场。噪声大到重音线索被掩掉时,人会退回词序,那时要靠词汇对比,不单靠突显。
怎么落地
- 选音色的听音材料里放焦点敏感句,不要只问「像不像人」。
- 产品名、转向、剂量这些载荷,宁可要更平、短语正确的声音,不要名人音色却把重音放错。
- 用强调标记把新信息标出来,听一遍不看稿,确认核重音落在该执行的那个词上。
- 验证:听完问「你下一步做什么 / 它推荐的是哪一项」。人引用了错误的成分,就是韵律问题,不是音量问题。