U8.03.1Significance markers do not convey the size of the effect设计

显著性标记不表达效应量的大小

别名: 显著性星号 · 效应量与显著性

概念解释

图表上的星号()或"显著"标签回答的是一个二元问题:"观察到的差异是否不太可能由随机波动解释"。它不回答"差异有多大"——而后者通常是决策真正需要的信息。0.1% 的转化率提升在足够大的样本下可以拿到三星显著性,但把它推给全部用户带来的绝对收益可能不足以覆盖更改的成本;反过来,一个有实际业务价值的 5% 提升在小样本试验中可能不显著而被放弃。显著性标记把"统计上可检测"和"实际上重要"这两件事在视觉上合并成了一个信号,误导读者用显著性来判断重要性。

机制

显著性由效应量与样本量共同决定(p 值本质上是"在效应为零的假设下,看到当前或更极端数据的概率"),样本量越大、同样效应的 p 值越小。这产生一个反直觉的后果:样本量大到一定程度后,任何微小的差异都会"显著"——大流量的 A/B 测试几乎总能给出带星号的结果,而这些结果的效应量可能小到没有商业意义。读者误读的来源是把星号当作效应的"强度"标签(三个星比一个星"更显著"因此"更好"),但实际上星号的数量只反映 p 值跨过的阈值(0.05、0.01、0.001),与差异的绝对或相对大小没有直接关系。视觉设计放大了这个误读:星号在图上通常比效应量数字更醒目(放在柱子上方,颜色更重),注意力被先吸引到显著性信号上,效应量成为次要信息。

边界

显著性标记并非没有价值:在样本量有限、噪声较大的场景(早期实验、小市场),显著性是防止把随机波动当作信号的守门员——它回答"这个差异是否值得进一步调查"。问题不在标记本身,而在把它作为唯一的、最醒目的信号。效应量与显著性的张力在超大型样本中最为极端(一切都显著),在小样本研究中最相反(重要效应可能不显著);中等规模的场景(几百到几千样本)两者的信息重叠最大,误读的代价相对最小。对于以"是否行动"为目的的仪表盘,效应量加置信区间几乎总是比星号更有信息量。

怎么落地

  • 图表上标注显著性的同时始终展示效应量(差值的绝对数或百分比),让两者并排可读。
  • 用视觉权重引导正确的读取顺序:效应量数字放在柱内或线端(主视觉),星号缩小放在角落(辅助标记)。
  • 在面向业务决策的仪表盘上,用"最小可检测效应"或置信区间替代星号,直接呈现"差异的范围"。
  • 验证:请读者复述一张带星号图表的结论;如果复述中只有"显著/不显著"而没有效应量的数字,说明版面把显著性当成了主信号。

延伸

  • 同组U8.03.2 多重比较未校正时显著性标记会系统性偏多 · U8.03.3 显著与不显著之间不存在视觉上的实质断点 · U8.03.4 图中标注显著性需说明所用的检验方法 · U8.03.5 展示效应量与区间比标注显著性提供更多信息
  • 相邻U8.01.1 点估计隐藏了区间信息 · U8.02.2 两组区间重叠并不等于差异不显著
  • 站内检索statistical significance · effect size · p-value visualization

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/U8.03.1