C7.10.3Partials reduce perceived latency设计研究

实时显示部分结果能缩短感知延迟,即使最终结果仍需等待处理完成

别名: 感知延迟 · perceived latency · 中间反馈

概念解释

从开口到终态文本可用,客观延迟可能仍有一秒以上(端点、网络、二遍解码)。在这段等待里把部分结果画出来,用户更早看见系统在工作,感知延迟下降。最终结果该等多久还等多久;变的是等待是否像死机。

机制

人对无反馈的等待特别苛刻。语音又没有按键那样的瞬时触感,开口之后若屏幕静止,很容易被判成没听见。部分结果提供连续的视觉进展,把死等切成“字在往外冒”。即终态还要等语言模型或服务器确认,首字已经承担了“我被听见了”的证明。这与波形证明麦克风进声是一层:波形说链路活着,部分结果说识别在产出符号。过早、乱跳的字也会提高焦虑,所以感知收益取决于稳定性,不是越早越好到不顾抖动。

怎么研究

用同样的客观端到端延迟,对比显示部分结果与只显示转圈。测量主观等待、是否重复说话、是否提前放弃。记录开口到“用户认为系统已响应”的时间。材料包含长句,短命令会把等待差压得很小。眼动可以看人是否在等的时候盯着空白输入框。

边界

终态若经常整句打脸,部分结果缩短的是感知延迟,也预支了信任,后面的替换会显得更假。免视场景看不见表,感知延迟要靠耳回读或声标,部分结果帮不上。本地极低延迟识别里,部分结果和终态几乎同时到达,收益接近零。网络极差时,过时的部分结果会造成“已经出字但其实流已断”的错觉。

怎么落地

  • 只要客观延迟超过大约半秒,就显示部分结果或同等的进展,避免空白加转圈。
  • 把首字延迟列入体验预算,与终态准确率一起看,而不是只优化后者。
  • 若部分结果会长时间冻结,配上仍在处理的状态,防止用户以为已经结束。

延伸

  • 同组C7.10.1 部分结果在用户说话过程中逐步显示尚未最终确认的识别文本 · C7.10.2 部分结果可能被后续内容修正甚至整体替换,与最终结果不保证一致 · C7.10.4 部分结果不应被用户当作可编辑的最终文本,需与终态区分样式
  • 相邻C7.16 语音输入的可见反馈 · C7.09 端点检测与说完判定
  • 站内检索perceived latency · streaming feedback · time to first token

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/C7.10.3