D2.06.3Interruptible and replayable speech设计研究
语音输出需支持中断与重听
别名: speech interruption · replay · barge-in
概念解释
可中断、可重听指用户能在语音播放过程中随时打断,也能让已经听过的内容再说一遍。语音不像文字可以回看,因此这两个操作是用户重新获得控制权的基本手段,而不是附加功能。
机制
语音一旦播完就消失,错过的片段无法通过滚动找回,只能依赖记忆或重新生成。人在听的过程中会走神、被环境打断、或在听到一半时已经获得所需信息,这时继续播放既浪费注意也可能覆盖后续重要内容。打断之所以重要,还因为它关系到对话双方的角色分配:不能打断的输出意味着用户只能等待,交互从双向退化为单向广播。
怎么研究
可用「打断延迟」与「重听成本」两个指标。前者测量用户发出停止指令到声音真正停止之间的间隔,间隔越长越容易被认为系统不听话;后者测量用户为重新获取某一段信息所付出的操作步数与时间。也可观察自然对话中的插话行为,据此设定打断的时机容忍度。研究需区分语音识别延迟与语音合成停止延迟,二者常被用户混为一谈。
边界
并非所有语音都应被随意打断。安全播报、法律告知或需要完整确认的流程中,提前中断可能导致信息缺失;此时正确的做法是允许暂停并记录,而不是直接终止。短促提示音本身无法被打断,也不适用重听要求,因为它们承载的是状态而不是内容。
怎么落地
- 让打断在任何时刻生效,并在打断后立即停止发声,不留下缓冲的尾音。
- 打断后提供清晰的接续选项:继续、重听本段、从头开始或直接跳过。
- 为关键语音保留文字记录,使用户能够回看被中断的内容而不是依赖记忆。
- 验证方式:在播放中途发出停止指令,测量实际停止延迟;再请用户不借助外部记录复述被中断段落,确认重听路径确实可达。