C7.16.3Processing state distinct from listening设计研究
识别结束后应明确标示流程转入处理阶段,与仍在聆听的状态区分
别名: 处理态 · thinking state · 聆听与处理
概念解释
端点之后,音频往往还要走完解码、技能路由、网络往返。这段时间系统已经不再聆听,而是在处理。若不换外观,用户会继续说,后半句进不了本轮,或被当成新的一轮。处理态必须和聆听态分开标。
机制
状态机在端点处从 capturing 进入 processing。麦克风可能已关,也可能仍开着等 barge-in,但本轮假设已经封口。若 UI 仍是波形在跳,人会以为还可以往上加词。若 UI 直接空白,又像死机。处理态用不同的动画、文案(“正在识别”)和停掉电平,宣告采集已结束、结果未到。这与部分结果仍在改写可以并存:部分结果是文本层,处理态是通道层——不再把新音频并进这一轮。和会话超时也不同:超时关掉的是整段参与;处理态是这一轮内部的阶段。
怎么研究
在人为拉长的处理延迟下,比较“外观仍像在听 / 明确处理态 / 无反馈”。测量端点后仍继续说的次数、这些话是否进入下一轮、以及主观是否知道该停。录音对齐端点时间与 UI 切换时间。
边界
本地极快的识别里处理态可能短到来不及画,直接出终态也可以。允许 barge-in 的对话系统在处理时仍可能在听打断,需要第三态“在听打断但不写入本轮”。电话 IVR 常用忙音当处理态。把处理画成仍在录,会在隐私上也说谎。
怎么落地
- 端点一宣布就切到与聆听互斥的处理外观,电平动画停掉。
- 处理超过预算时间要有进展,而不是无限转圈。
- 用延迟注入验收:处理期间新说的话不得并入本轮转写,除非产品明确支持追加。