C7.16.3Processing state distinct from listening设计研究

识别结束后应明确标示流程转入处理阶段,与仍在聆听的状态区分

别名: 处理态 · thinking state · 聆听与处理

概念解释

端点之后,音频往往还要走完解码、技能路由、网络往返。这段时间系统已经不再聆听,而是在处理。若不换外观,用户会继续说,后半句进不了本轮,或被当成新的一轮。处理态必须和聆听态分开标。

机制

状态机在端点处从 capturing 进入 processing。麦克风可能已关,也可能仍开着等 barge-in,但本轮假设已经封口。若 UI 仍是波形在跳,人会以为还可以往上加词。若 UI 直接空白,又像死机。处理态用不同的动画、文案(“正在识别”)和停掉电平,宣告采集已结束、结果未到。这与部分结果仍在改写可以并存:部分结果是文本层,处理态是通道层——不再把新音频并进这一轮。和会话超时也不同:超时关掉的是整段参与;处理态是这一轮内部的阶段。

怎么研究

在人为拉长的处理延迟下,比较“外观仍像在听 / 明确处理态 / 无反馈”。测量端点后仍继续说的次数、这些话是否进入下一轮、以及主观是否知道该停。录音对齐端点时间与 UI 切换时间。

边界

本地极快的识别里处理态可能短到来不及画,直接出终态也可以。允许 barge-in 的对话系统在处理时仍可能在听打断,需要第三态“在听打断但不写入本轮”。电话 IVR 常用忙音当处理态。把处理画成仍在录,会在隐私上也说谎。

怎么落地

  • 端点一宣布就切到与聆听互斥的处理外观,电平动画停掉。
  • 处理超过预算时间要有进展,而不是无限转圈。
  • 用延迟注入验收:处理期间新说的话不得并入本轮转写,除非产品明确支持追加。

延伸

  • 同组C7.16.1 用户说话期间需要持续的视觉反馈证明系统正在采集 · C7.16.2 音量或波形动画反馈让用户判断麦克风是否收到声音而非设备故障 · C7.16.4 缺少可见反馈时用户无法判断沉默是系统未响应还是正常等待
  • 相邻C7.09 端点检测与说完判定 · C7.10 部分结果的实时显示
  • 站内检索processing state · barge-in · listening versus thinking

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/C7.16.3