U8.03.3There is no visual cliff between significant and non-significant设计

显著与不显著之间不存在视觉上的实质断点

别名: 显著性阈值 · p=0.05 神话

概念解释

p=0.049 与 p=0.051 之间的差异在统计证据的强度上几乎为零——但图表的视觉语言把它们呈现为两个不同的类别:一个有星号一个没有,一个实色一个灰色。显著性阈值是人为选择的惯例(Fisher 当年选 0.05 是为了方便查表,不是因为它有数学上的特殊性),跨过阈值的瞬间没有任何统计实质发生变化。当可视化用截然不同的视觉编码表达阈值两侧时,它在暗示一个不存在的断点,读者据此把 p=0.049 的结果当作"真"而把 p=0.051 的结果当作"无"——两者的实际可信度差距远小于视觉呈现暗示的差距。

机制

断点错觉的根源在于类别化编码对连续量的失真表达:p 值是连续变量,显著性判断把它在 0.05 处切成两半,视觉编码(有星号/无星号、有色/灰色)进一步强化了"这是两个类别"的感知。类别化在视觉认知中的代价是边界效应:人类感知对类别边界的两侧差异高度敏感(蓝/绿的分界两侧的色块被判断为"不同颜色"),而边界内的大幅差异被相对忽视(两个深浅不同的绿被判断为"都是绿")。应用到显著性标记上:p=0.049 与 0.051(跨边界,微差)被感知为根本不同的结论,p=0.001 与 0.049(同边界内,大差)被感知为相同的结论。证据强度完全不同的两组比较被视觉编码强行等同。此外,阈值的惯例性质意味着不同的领域、不同的期刊、不同的公司可能用不同的阈值(0.05、0.01、0.1),但图上的视觉断点看起来同样绝对——阈值的选择历史与主观性在视觉上完全不可见。

边界

这不是说显著性判断没有价值:在需要二分决策的场景(上线/不上线、投产/不投产),阈值是决策规则的一部分,视觉上的二分标记与决策结构一致。问题出在把决策辅助工具当作证据本身的度量。p 值接近阈值的"边缘结果"在任何方向上都不应该被强解读——p=0.049 不证明效应存在,p=0.051 也不证明效应不存在,两者都是"证据不足以下结论"的表达。对仪表盘设计而言,用视觉断点表达一个连续的证据强度是浪费了图表的信息容量:同一张图完全可以在呈现连续 p 值或置信区间的同时,用更轻量的方式(如次要颜色的参考线)标出决策阈值。

怎么落地

  • 在可能时直接显示连续的 p 值或置信区间,而不是只显示跨阈值后的二值标记。
  • 必须二分标记时,用视觉权重(颜色深浅、标记大小)编码 p 值离阈值的远近,避免边界两侧呈现为完全不同类别。
  • 图注注明阈值的约定来源("按团队标准 α=0.05"),让读者知道这是惯例而非自然分界。
  • 验证:找出图表中所有因阈值差异而被区别对待的比较对(如 p=0.048 与 p=0.052),核对它们在图上的视觉差异是否与证据强度的实际差距相称。

延伸

  • 同组U8.03.1 显著性标记不表达效应量的大小 · U8.03.2 多重比较未校正时显著性标记会系统性偏多 · U8.03.4 图中标注显著性需说明所用的检验方法 · U8.03.5 展示效应量与区间比标注显著性提供更多信息
  • 相邻U8.01.3 未标注不确定性等于宣称确定 · U8.03.1 显著性标记不表达效应量的大小
  • 站内检索p-value threshold · dichotomization · boundary effect

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/U8.03.3