C7.09.3Fixed silence threshold versus speaking rate设计研究
固定静音阈值对语速快慢不同的用户效果不一致
别名: 语速 · speaking rate · 自适应端点 · 快慢说
概念解释
同一条以毫秒计的静音阈值,对语速快的人和语速慢的人不是同一件事。快说者的词间间隙短,固定阈值相对偏长,他们会觉得系统反应钝;慢说者、老人、第二语言使用者的词间间隙经常超过阈值,同一设置会把一句切成两截。效果不一致来自用绝对时间去卡相对语速。
机制
人的停顿尺度跟着音节速率走。快语速下,句中间隙可能只有一两百毫秒;慢语速下,搜索下一个词可以停半秒以上仍打算继续。阈值是墙钟时间,不读说话人的速率估计。于是同一产品在实验室用中等语速调好的 700 毫秒,到了快说用户那里浪费等待,到了慢说用户那里制造过早封口。自适应做法用近窗音节率或音素率去缩放阈值,或对已观测到的该用户历史速率做贝叶斯更新。这与思考停顿冲突相关但不是同一轴:思考停顿是内容计划,语速是发音节律;一个人可以既快又不思考,也可以既慢又在计划。
怎么研究
让同一批句子由快、中、慢说话人(或同一人被指示改变语速)来说,固定阈值扫描过早切分和额外等待。再跑速率自适应版本对比。报告按语速分层,而不是平均掉。老年组和 L2 组应单列。不要只在播音员语速上定阈值。
边界
极端快说会把音素都粘连,端点还没轮到,识别先垮。歌唱、连祷和故意拉长的强调音节会骗过速率估计。按键说话不依赖这条阈值。联合语义端点可以部分补偿慢说者的长间隙,但识别若也因慢而插入静音帧,补偿有限。
怎么落地
- 不要用单一毫秒数服务所有人;按用户或按会话估计语速并缩放尾静音。
- 给慢说和无障碍档案提供更长的默认阈值,且不要把这档做成难以发现的开关。
- 回归集按语速分层验收过早切分,禁止只看中等语速均值达标。