L1.11.5one draw cannot rank two systems设计研究

单次对比不足以判定两个方案孰优,结论必须建立在多次采样上

别名: 单次对比无效 · 多样本评价 · n greater than one

概念解释

产品会把「新提示」和「旧提示」、「模型 A」和「模型 B」并排各跑一次,赢的那次被写成改进。一次对一次,比的是两个随机数。单次对比排不了名(one draw cannot rank two systems):名次是对分布的陈述,陈述必须来自多次采样。

并排给用户选方案,是在选这一次的喜好。用同一次并排去宣布系统谁更好,是把选择任务偷换成评估任务。

机制

两个高方差分布,各取一点,点的序与均值的序可以相反。生成质量的方差通常不小,一次幸运足以让差的系统赢。发布会、A/B 评审、提示调优若停在 n=1,优化的是运气。统计上这是最浅的抽样误差,却因为界面擅长做一次并排而被忽略。

人还会把一次赢读成稳定优势,随后的决策(切模型、改默认提示)锁在这个误判上。不可复现在评估环节的表现,就是把 n=1 当成 n=∞。

怎么研究

用已知均值差和方差的两套输出器,模拟产品现有的「各跑一次就投票」。看投票选对均值更好者的概率。再把 n 提到 5、11、30。自变量:方差、真差值、是否盲序。因变量:选对率、决策后悔(切过去之后长期指标下降)。

真差值小时,n=1 的选对率接近抛硬币。这是该拿给评审会看的图。

边界

用户在一次会话里选主题、选构图,n=1 是对的,因为对象是这一次,不是系统。探索阶段用一次并排找灵感,也不该当成基准测试。自动化评估若每次请求内部已经对多样本做了聚合,表面上的「一次」其实是 n>1,要在方法里写出来,免得别人以为你们也在单点对比。这条不处理追溯要存什么。

怎么落地

  • 凡是要宣布 A 优于 B 的比较,写 n 和聚合方式。n=1 不许进发布说明。
  • 评审界面默认成对多次,或先采样再盲评,而不是各出一张漂亮图。
  • 把「用户选了这一张」和「系统更好」分成两个事件,不要用前者的计数当后者的证据。
  • 验证:把你们上次宣布的改进拿来,看它的 n。n=1,声明降级为「有一次看起来更好」。再用同一提示各抽 10 次看序是否还在——不在,当时的对比只是运气。

延伸

  • 同组L1.11.1 同一输入得到不同输出使缺陷难以复现,用户报告的问题可能无法重演 · L1.11.2 固定随机种子只能在同一版本内复现,模型或提示更新后即失效 · L1.11.3 无法复现使用户难以形成稳定心智模型,学习曲线被拉平 · L1.11.4 事后追溯需要同时保存输入、系统版本与输出三者
  • 相邻L3.07 多方案生成与并列比较 · L3.13 生成质量的用户反馈回路 · L1.01 概率性输出与确定性界面的错配
  • 站内检索n greater than one · single-draw comparison · evaluate distributions

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L1.11.5