多重比较未校正时显著性标记会系统性偏多
别名: 多重比较 · 假阳性膨胀
概念解释
显著性检验的 p 值阈值(如 0.05)控制的是"单次比较中假阳性的概率"。当图表同时呈现很多组的比较(20 个指标的对比、几十个细分维度的切片),每次比较各自有 5% 的假阳性率,至少一个假阳性出现的整体概率随比较次数迅速上升:做 20 次独立比较,至少一次"显著"的概率约是 64%;做 100 次,约是 99%。未做多重比较校正的图表上的显著性标记,因此不是"这些差异都值得注意",而有一部分是纯粹的统计噪声被噪声筛选器捞了起来。
机制
假阳性膨胀的数学根源是概率的累积:每次检验的假阳性概率是独立的(近似地),多次检验后"至少一次假阳性"的概率是 1-(1-α)^n,随 n 指数式趋近于 1。仪表盘的交互设计天然制造多重比较:用户可以自由筛选维度、切换时间段、对比任意两组——每一次操作本质上是一次额外的隐式检验,但没有任何系统在做校正。更隐蔽的是研究者的"花园小径"(garden of forking paths):分析者往往在看过数据后才决定比较哪些组、用哪种检验,这个选择本身已经利用了随机波动,使得最终被标注为"显著"的结果偏向于恰好通过了阈值的那些比较。视觉层面,星号一经标注就被读者当作事实接受,没有人会在看图时重新计算"这 15 个显著结果里有几个可能是假的"——膨胀的假阳性被视觉形式固化成了结论。
怎么研究
研究多重比较膨胀的经典方式是模拟研究:在"所有组真实无差异"的零假设数据上运行与真实仪表盘相同的比较流程,统计被标注为显著的比较比例——理论上应接近阈值 α,实际往往远高。在用户研究中,可以给被试呈现已知校正状态的图表(已校正 vs 未校正),测量他们对显著结果数量的信任度和基于这些结果做出的决策质量。方法论的注意点:多重比较的"比较次数"本身是模糊的——是图中可见的比较,还是用户在会话中执行过的所有筛选与对比的组合?这个定义模糊性使得"应该校正几次"没有唯一答案,也是实践者回避校正的常见理由。
边界
多重比较校正不是在所有场景都必要:探索性分析(寻找值得进一步检验的假设)与验证性分析(对预设假设做最终判断)遵循不同的规则——前者允许较高的假阳性以换取灵敏度,后者必须严格校正。仪表盘大多是探索场景,把它按验证标准要求会过度保守;但在仪表盘结果直接触发行动(如自动下线表现差的广告组)时,每张图表就是一次验证性判断,校正不可省略。校正方法的选择(Bonferroni 最保守、Benjamini-Hochberg 控制错误发现率更平衡)也会影响图上"显著"的数量,没有唯一正确的方法。当组间比较本身有内在相关性(同一用户群的相邻年龄段),有效比较次数低于名义次数,过度校正会牺牲检验力。
怎么落地
- 图表呈现 3 组以上对比的显著性标记时,在图注声明是否做了多重比较校正及所用方法。
- 自动触发行动的仪表盘(异常检测、自动下线)必须内置校正,并把校正后的阈值写进告警配置。
- 探索型仪表盘可不做校正,但需要在显著标记旁标注"探索性结果,需验证",与验证型结论区分。
- 验证:对一张多组对比图,在"所有组真实相同"的模拟数据上重跑其比较流程,统计图上的显著标记有多少在模拟中依然出现;比例接近 α 即校正到位,远高于 α 即存在膨胀。