C7.10.3Partials reduce perceived latency设计研究
实时显示部分结果能缩短感知延迟,即使最终结果仍需等待处理完成
别名: 感知延迟 · perceived latency · 中间反馈
概念解释
从开口到终态文本可用,客观延迟可能仍有一秒以上(端点、网络、二遍解码)。在这段等待里把部分结果画出来,用户更早看见系统在工作,感知延迟下降。最终结果该等多久还等多久;变的是等待是否像死机。
机制
人对无反馈的等待特别苛刻。语音又没有按键那样的瞬时触感,开口之后若屏幕静止,很容易被判成没听见。部分结果提供连续的视觉进展,把死等切成“字在往外冒”。即终态还要等语言模型或服务器确认,首字已经承担了“我被听见了”的证明。这与波形证明麦克风进声是一层:波形说链路活着,部分结果说识别在产出符号。过早、乱跳的字也会提高焦虑,所以感知收益取决于稳定性,不是越早越好到不顾抖动。
怎么研究
用同样的客观端到端延迟,对比显示部分结果与只显示转圈。测量主观等待、是否重复说话、是否提前放弃。记录开口到“用户认为系统已响应”的时间。材料包含长句,短命令会把等待差压得很小。眼动可以看人是否在等的时候盯着空白输入框。
边界
终态若经常整句打脸,部分结果缩短的是感知延迟,也预支了信任,后面的替换会显得更假。免视场景看不见表,感知延迟要靠耳回读或声标,部分结果帮不上。本地极低延迟识别里,部分结果和终态几乎同时到达,收益接近零。网络极差时,过时的部分结果会造成“已经出字但其实流已断”的错觉。
怎么落地
- 只要客观延迟超过大约半秒,就显示部分结果或同等的进展,避免空白加转圈。
- 把首字延迟列入体验预算,与终态准确率一起看,而不是只优化后者。
- 若部分结果会长时间冻结,配上仍在处理的状态,防止用户以为已经结束。