Q3.22.1Family-wise error from testing many metrics设计研究

同时检验多个指标会提高假阳性出现的概率

别名: 多指标假阳性 · 族错误率 · 指标越多越显著

概念解释

一次实验同时拿转化、时长、评分、点击、留存等许多结果做显著性检验,每一次都在名义 α 下可能把纯噪声判成效应。检验次数增加,至少出现一次假阳性的概率——族错误率(family-wise error rate)——跟着上升。五个独立的 0.05 检验,全为噪声时仍有大约 1−0.95⁵ 的机会“至少有一个显著”,远高于 5%。这是指标件数带来的错误率膨胀,不是事后在细分人群里挑一格,也还不是如何校正或指定主指标的手续。

机制

每个检验都在自己的零假设下维持尾概率。零假设同时为真时,多次独立拒绝事件会并集:指标越多,总有一个过线的机会越大。界面实验天然指标很多,它们还常常相关,膨胀系数不是简单的次数相乘,但方向不变——多测就会多假发现。团队再把“哪个显著就讲哪个”,等于在已经膨胀的名单里做第二次选择,故事总有得讲。仪表盘把几十个结果刷绿,视觉上像丰收,统计上只是多次抛硬币。错误率是对整张结果表而言的,不是对讲出来的那一行而言的。

怎么研究

在分析计划里列出将被检验的全部指标,并计算或仿真在全局零假设下“至少一显著”的概率。报告同时给出检验次数和未校正的显著个数。用置换或模拟在打乱处理标签后重跑整张表,看名义显著率;高于 α,说明膨胀已经发生。相关指标可用多元检验或联合模型一次回答,而不是假装十次单变量检验互相无关。探索性指标与确证性指标分表,确证表的错误率才按族来解释。

边界

描述性展示很多指标而不做检验,不产生族错误率,前提是语言保持描述。强相关的指标(同一漏斗的相邻步)膨胀小于独立情形,仍不是零。安全或公平清单上每一项都必须单独过关时,控制的是漏报伤害,可以接受更高的假阳性,但要显式交换,而不是假装没有多次检验。一次只检验一个预注册指标,膨胀不在这一层出现。

怎么落地

  • 结果页顶部写明“本实验检验了 k 个指标”;k 不出现则稿件退回。
  • 禁止用“其中有三项显著所以改动有效”作为摘要:三项来自一张更长的表。
  • 仪表盘上未纳入检验名单的指标不得标星号。
  • 验证:把处理标签打乱重跑同一张表,仍出现若干星号,则原星号不得当作发现。

延伸

  • 同组Q3.22.2 多重比较需要校正显著性阈值或提前限定主指标 · Q3.22.3 从大量细分结果中挑选显著项汇报是数据窥探 · Q3.22.4 主指标应在实验开始前锁定,而非结束后择优选择
  • 相邻Q3.21 统计显著性与效应量 · Q3.05 多变量测试
  • 站内检索family-wise error · multiple endpoints · false positive

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/Q3.22.1