C7.09.1Silence versus semantic endpointing设计研究

端点检测可以仅靠静音时长判断,也可以结合语义完整性联合判断

别名: 语义端点 · end-of-query · 联合判定 · EOQ

概念解释

说完判定可以只用声学:静音时长够了就封口;也可以把部分识别结果是否像一条完整查询(语义完整性、end-of-query)一并送进判决。后者是联合判断:句子在语法和槽位上已经能执行,才允许较短的静音去提交;看起来还没说完,就延长等待。这是操作层的策略选择,不是“要不要做端点”。

机制

纯静音检测器看不见词。联合模型用流式 ASR 的部分假设估计“这句话作为查询是否已经可执行”——祈使句的动词和宾语齐了、问句的疑问结构齐了,后验升高。声学静音仍作为证据,但权重随语义后验变化:完整查询上,200 毫秒静音也许够;不完整的“帮我查一下……”后面要等更久。语言模型偏置和领域文法会强烈影响这条后验,把口头禅当成未完成或把省略句当成完成。代价是判决依赖识别质量:识别错了,语义完整性会被骗。纯静音不骗于词,但会在思考停顿上提前下手。

怎么研究

同一批自发查询跑静音-only 与联合模型,比较过早提交率、过晚等待、以及提交时假设是否可执行。把槽位未填完的句子单独成组。自变量包括领域(短命令 vs 听写)。联合模型还要报“因识别错而导致的错误封口”。不要用朗读完整句当唯一语料,那会让语义完整性几乎总是真。

边界

听写段落往往故意不完整(还要继续),语义完整性会错误地催促封口,听写应偏声学或由用户点完成。命令词表极小且句式固定时,联合判断收益小。识别极差时,联合判断比纯静音更不稳。语义完整不等于用户主观上说完:他们可能还要加一个否定。

怎么落地

  • 短命令用联合判断加快提交;听写和开放口述关掉语义催促,只保留静音或显式完成键。
  • 当部分结果显示槽位明显未完(只有动词没有宾语)时,禁止因短静音提交。
  • A/B 时同时看过早执行和平均等待,不要只优化其中一个。

延伸

  • 同组C7.09.2 语调下降与语速放缓等韵律线索可以辅助判断话语是否结束 · C7.09.3 固定静音阈值对语速快慢不同的用户效果不一致 · C7.09.4 端点判定错误无法在事后修正,只能靠用户重新说一遍或手动确认结束
  • 相邻C7.02 端点检测 · C7.10 部分结果的实时显示
  • 站内检索end-of-query · semantic endpointing · joint VAD

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/C7.09.1