L1.12.1generation latency sits in the felt-wait band设计研究

生成延迟通常落在用户能感知等待但尚不会放弃的秒级区间

别名: 秒级等待 · 可感知未放弃 · 2-to-10-second generation

概念解释

按钮点下去,第一批字往往在两秒到十几秒之间出现。短于大约一秒,等待还不成为事件;长过大约十秒,人开始找别的事做或放弃。生成恰好挤在能感到等待、还不会走的带子里。带子决定了体验问题的种类:不是「要不要做进度条」那么大,也不是「无感」,而是这段空白必须被交代。

这条只定位延迟落在哪一档。流式怎样改感知、半成品怎样诱使判断,是后面的事。

机制

人对空档的分类大致按数量级:即时、可忍的停顿、要解释的等待、该离开的等待。经典界面延迟研究把这些档和反馈形式绑在一起。生成把计算从本地毫秒级换成远端采样,均值掉进第二、第三档之间,方差还很大——有时 1.5 秒,有时 20 秒。同一控件不能稳定地属于一个档,反馈形式也就不能只做一种。

落在带子里还有一个社交效果:人会开始对空白做归因(坏了?在想?在偷懒?)。归因发生在任何字出现之前,已经在给这次生成定价。

怎么研究

测你们产品的首字时间和总时间分布,叠在放弃曲线上。自变量:有无「正在写」的活反馈、是否给出粗的剩余量级。因变量:放弃、归因(故障 / 思考 / 正常)、空白期的二次点击。

分布必须报,不能只报均值。均值在带子里、长尾在放弃区,体验由长尾决定。

边界

本地小模型或缓存命中会掉进即时档,带子上的设计会成噪声。批量、过夜任务掉出带子,该按后台任务做,不要硬挤进对话气泡。弱网把网络延迟和生成延迟叠在一起,归因会指向网而不是模型,反馈要能分开说。这条不讨论流式是否该上。

怎么落地

  • 在 1 秒仍无首字时给出活的「正在生成」,不要空白转圈到放弃。
  • 按分布而不是按均值挑反馈:P95 若已出带子,就要有可离开或可看进度的出口,不能假设人人都在均值上。
  • 二次点击不要当成新请求叠上去;带子里的连点多半是焦虑,不是新意图。
  • 验证:画首字时间直方图和放弃时间。直方图的肚子若在 2–10 秒而你们在 8 秒前没有任何活反馈,空白在无人认领。再看 P95 是否已经该当后台任务。

延伸

  • 同组L1.12.2 流式输出缩短的是首字时间而非总时长,改变的是感知而非事实 · L1.12.3 逐字出现会诱使用户在结果完成前开始判断,从而基于半成品做决定 · L1.12.4 流式过程中的自我修正会让用户看到随后被推翻的中间内容 · L1.12.5 后台长任务不适合流式,它需要的是进度与允许离开
  • 相邻L3.11 生成过程的流式呈现 · I2.07 感知性能 · L1.06 AI 失败的优雅降级
  • 站内检索felt-wait band · time to first token · generation latency

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L1.12.1