C7.02.2Silence timeout versus thinking pause设计研究

静音时长阈值与思考停顿的冲突

别名: trailing silence · 思考停顿 · hangover · 静音门限

概念解释

多数端点检测器用尾随静音时长(trailing silence)当结束证据:语音之后连续非语音超过阈值,就宣布说完。人在组织下一小句时也会停——那是思考停顿(planning pause / hesitation),不是句末。同一段静音因此有两种解释,阈值只能偏向其中一侧。

机制

能量或神经网络 VAD 给出的是帧级语音/非语音,并不知道说话人是否还打算继续。设计者于是把连续非语音的积分当成代理:短于阈值当呼吸或塞音间隙,长于阈值当结束。思考停顿、词间搜索、数字和地址里的组块间隙,时长分布与真正的句末静音大量重叠。阈值短,系统显得敏捷,但会把句中停顿当成结束;阈值长,停顿被容忍,但每次真实句末都要多等。填充词(“那个”“um”)能把停顿重新标成语音,反而可能推迟结束。这个冲突来自用一个标量去近似“还想不想说”,而不是来自麦克风坏了。

怎么研究

采集带标注的自发指令:句中停顿、句末停顿、数字串、列菜单。把同一批音频接到不同静音阈值上,画过早结束率对额外等待的曲线。自变量包括任务是否需要当场构思、是否允许填充词、语言类型(有无长停顿习惯)。因变量不要只用字错误率:还要计“被切在从句中间的次数”和“用户开始补说时系统已经提交的次数”。朗读材料会系统性压低思考停顿,不适合单独拿来定阈值。

边界

对只含固定短命令的词表,思考停顿很少,短阈值伤害不大。听写长句、口述地址和药名时冲突最大。通话降噪若把轻声也打成非语音,等效阈值会被悄悄缩短。嘈杂环境里 VAD 把噪声当成语音,静音积分可能永远凑不够,阈值再长也切不出去。语义是否完整、语调是否下降,是另一层判决,不能用来否认静音阈值本身已经在和停顿抢时间。

怎么落地

  • 按任务分开阈值:短命令用短尾静音,听写和表单用更长的尾静音,不要全局一个常数。
  • 在用户明显还在组织语言时(刚说出“然后”“就是”)推迟结束,而不是把填充词当噪声切掉。
  • 用同一批真实口述调阈值,同时报告过早结束次数和平均多等毫秒数,让产品在两条曲线上选点。

延伸

  • 同组C7.02.1 系统需判断用户何时说完 · C7.02.3 过早截断导致内容丢失且无法恢复
  • 相邻C7.09 端点检测与说完判定 · C7.15 语音输入的长度上限
  • 站内检索trailing silence · planning pause · endpoint timeout

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/C7.02.2