C7.09.3Fixed silence threshold versus speaking rate设计研究

固定静音阈值对语速快慢不同的用户效果不一致

别名: 语速 · speaking rate · 自适应端点 · 快慢说

概念解释

同一条以毫秒计的静音阈值,对语速快的人和语速慢的人不是同一件事。快说者的词间间隙短,固定阈值相对偏长,他们会觉得系统反应钝;慢说者、老人、第二语言使用者的词间间隙经常超过阈值,同一设置会把一句切成两截。效果不一致来自用绝对时间去卡相对语速。

机制

人的停顿尺度跟着音节速率走。快语速下,句中间隙可能只有一两百毫秒;慢语速下,搜索下一个词可以停半秒以上仍打算继续。阈值是墙钟时间,不读说话人的速率估计。于是同一产品在实验室用中等语速调好的 700 毫秒,到了快说用户那里浪费等待,到了慢说用户那里制造过早封口。自适应做法用近窗音节率或音素率去缩放阈值,或对已观测到的该用户历史速率做贝叶斯更新。这与思考停顿冲突相关但不是同一轴:思考停顿是内容计划,语速是发音节律;一个人可以既快又不思考,也可以既慢又在计划。

怎么研究

让同一批句子由快、中、慢说话人(或同一人被指示改变语速)来说,固定阈值扫描过早切分和额外等待。再跑速率自适应版本对比。报告按语速分层,而不是平均掉。老年组和 L2 组应单列。不要只在播音员语速上定阈值。

边界

极端快说会把音素都粘连,端点还没轮到,识别先垮。歌唱、连祷和故意拉长的强调音节会骗过速率估计。按键说话不依赖这条阈值。联合语义端点可以部分补偿慢说者的长间隙,但识别若也因慢而插入静音帧,补偿有限。

怎么落地

  • 不要用单一毫秒数服务所有人;按用户或按会话估计语速并缩放尾静音。
  • 给慢说和无障碍档案提供更长的默认阈值,且不要把这档做成难以发现的开关。
  • 回归集按语速分层验收过早切分,禁止只看中等语速均值达标。

延伸

  • 同组C7.09.1 端点检测可以仅靠静音时长判断,也可以结合语义完整性联合判断 · C7.09.2 语调下降与语速放缓等韵律线索可以辅助判断话语是否结束 · C7.09.4 端点判定错误无法在事后修正,只能靠用户重新说一遍或手动确认结束
  • 相邻C7.02 端点检测 · C7.04 口音、方言与语言混用
  • 站内检索speaking rate · adaptive endpointing · silence threshold

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/C7.09.3