同时检验多个指标会提高假阳性出现的概率
别名: 多指标假阳性 · 族错误率 · 指标越多越显著
概念解释
一次实验同时拿转化、时长、评分、点击、留存等许多结果做显著性检验,每一次都在名义 α 下可能把纯噪声判成效应。检验次数增加,至少出现一次假阳性的概率——族错误率(family-wise error rate)——跟着上升。五个独立的 0.05 检验,全为噪声时仍有大约 1−0.95⁵ 的机会“至少有一个显著”,远高于 5%。这是指标件数带来的错误率膨胀,不是事后在细分人群里挑一格,也还不是如何校正或指定主指标的手续。
机制
每个检验都在自己的零假设下维持尾概率。零假设同时为真时,多次独立拒绝事件会并集:指标越多,总有一个过线的机会越大。界面实验天然指标很多,它们还常常相关,膨胀系数不是简单的次数相乘,但方向不变——多测就会多假发现。团队再把“哪个显著就讲哪个”,等于在已经膨胀的名单里做第二次选择,故事总有得讲。仪表盘把几十个结果刷绿,视觉上像丰收,统计上只是多次抛硬币。错误率是对整张结果表而言的,不是对讲出来的那一行而言的。
怎么研究
在分析计划里列出将被检验的全部指标,并计算或仿真在全局零假设下“至少一显著”的概率。报告同时给出检验次数和未校正的显著个数。用置换或模拟在打乱处理标签后重跑整张表,看名义显著率;高于 α,说明膨胀已经发生。相关指标可用多元检验或联合模型一次回答,而不是假装十次单变量检验互相无关。探索性指标与确证性指标分表,确证表的错误率才按族来解释。
边界
描述性展示很多指标而不做检验,不产生族错误率,前提是语言保持描述。强相关的指标(同一漏斗的相邻步)膨胀小于独立情形,仍不是零。安全或公平清单上每一项都必须单独过关时,控制的是漏报伤害,可以接受更高的假阳性,但要显式交换,而不是假装没有多次检验。一次只检验一个预注册指标,膨胀不在这一层出现。
怎么落地
- 结果页顶部写明“本实验检验了 k 个指标”;k 不出现则稿件退回。
- 禁止用“其中有三项显著所以改动有效”作为摘要:三项来自一张更长的表。
- 仪表盘上未纳入检验名单的指标不得标星号。
- 验证:把处理标签打乱重跑同一张表,仍出现若干星号,则原星号不得当作发现。