端点检测决定系统何时认为用户说完了
别名: 话轮让渡判定 · 说完了 · end-of-turn
概念解释
用户说「提醒我打电话……呃……给妈妈,明天下午三点」。若系统在「打电话」之后就开口,它不是识别错了词,是把话轮抢走了。端点即让渡(endpointing as turn yield)指:用来判断「这句话结束了」的那次判定,在对话里等于系统宣布自己拿到了说话权。声学上怎么切语音活动,是输入侧的事;这里管的是切完之后谁拿到了话轮权(floor)、碰撞如何被听见。
机制
人类轮流靠转换关联位置:句法可结束、语调下落、出现可让出的缝。机器用静音时长或「查询是否完整」的分数去近似这一点。分数一过线,系统就开始自己的话轮——提问、确认、执行前的复述。切早了,用户的话轮构建成分还没闭合,两个人同时说话,用户必须重说后半截。切晚了,用户已经让出,房间里出现一段无主的空白,像没人接球。
所以端点不是中性的录音裁剪,它是一次占权动作。同一套能量门限,在对话里会表现为抢话或冷场。输入通道可以只报告「现在没有声」;对话系统必须把「没有声」翻译成「对方把话轮让给我了」或「对方只是换气」。翻错的代价发生在话轮层:被切断的人会提高音量、或改成更短更冲的句子,不是去调整自己的声门。
怎么研究
把真实指令做话轮碰撞标注:系统开始出声的时刻,用户是否仍在说(切断),以及用户停稳到系统开口的间隙(滞后)。对照人工标出的转换关联位置,而不是对照能量曲线自己的阈值。因变量是切断率、滞后毫秒、以及切断之后用户的修复方式(重说、打断系统、放弃)。
不要在这条上重做语音活动检测的 ROC。那套曲线回答的是「这段是不是语音」;这里要的是「系统开口是否落在对方已经让出的位置」。驾驶或双手占用条件下,人口语里的缝会变长,碰撞分布会跟着移,实验室安静桌面测到的「最佳静音门限」不能直接当对话策略。
边界
流式识别可以在端点之前就开始理解,不等待让渡完成——那只改变内部计算,不取消「何时开口」仍是一次占权。用户打断系统播报,方向相反,由打断检测负责。两人同时对同一设备说话时,根本没有单一的让渡者。极短的命令(「暂停」「关掉」)几乎没有内部缝,端点早晚的代价不对称地偏向「宁可稍晚」。
怎么落地
- 把端点超时当成产品上的话轮参数,而不是藏在识别器里的常数。对老年用户或需要报长数字的槽,默认更晚让系统开口。
- 若系统开口后几十到一百多毫秒内用户又继续说,按切断处理:停掉自己的话轮,保留已识别的前半句,等对方说完再接,不要把半截当完整指令执行。
- 验收看碰撞,不看词错误率:抽样会话,数「系统出声时用户仍在说」的比例。这个比例降不下来,调的就是让渡,不是词表。