U8.02.1Whether an error bar shows standard deviation, standard error, or confidence interval must be stated设计研究

误差棒代表标准差、标准误还是置信区间必须标明

别名: 误差棒语义 · 区间类型标注

概念解释

"误差棒"这个视觉元素本身没有绑定唯一的统计含义——同一个长度的误差棒可以是标准差(数据本身的波动幅度)、标准误(均值估计的精度)、或 95% 置信区间(真实值有 95% 概率落入的范围)。三者的数值差异可达数倍(对于 n=100 的样本,95% CI 约是标准误的两倍,而标准差约是标准误的十倍),读者如果把标准差误读为置信区间,会把数据的波动误当成估计的精度,得出过于乐观或过于悲观的结论。不标注类型等于让每位读者自行猜测含义——而猜测的结果因人不同而不同。

机制

误读的根源在于三种统计量回答的是不同的问题,但共享同一个视觉形态。"数据的波动范围有多大"由标准差回答;"均值估计有多准"由标准误回答(标准误 = 标准差 / √n);"真实均值落在哪个范围"由置信区间回答(通常约等于标准误乘以 2)。这三种问题对应三种不同的决策:评估过程稳定性看标准差,评估估计可信度看标准误,判断是否超过阈值看置信区间。读者面对一个未标注的误差棒时,会根据自己当前的任务隐式地选择一种解读——做阈值判断的人倾向于读成置信区间,评估波动的人倾向于读成标准差——而制图者实际画的可能是第三种。任务与语义的错位不产生任何视觉冲突信号,只在决策层面显现为错误的判断。Belia、Fidler、Williams 与 Cumming 对研究者理解误差棒的调查发现,即使是有统计训练的研究者,在未标注条件下对误差棒含义(标准误还是置信区间)的判断也大量出错,准确率明显低于预期水平。

怎么研究

研究误差棒语义误读的实验设计是解读任务:给被试呈现相同数据但误差棒含义不同(标准差 vs 置信区间)的图表,测量他们在不同任务指令下(判断两组是否有差异 / 判断波动范围)的解读准确率。变量包括误差棒的统计含义、标注条件(无标注 / 文字标注 / 图例标注)、被试的统计训练程度。在真实仪表盘场景中,可以通过用户访谈或出声思维了解读者对现有图表中误差棒的默认假设。方法论的注意点:实验室里任务指令明确指定了该读什么,真实场景中读者自行决定读什么——指令条件下的准确率高估了真实使用中的准确率。

边界

标注的必要性取决于读者群体:统计训练充分的读者(如学术审稿人)可以从上下文推断误差棒含义,但推断依赖领域惯例(生物学论文通常用标准误,心理学通常用置信区间),跨领域阅读时推断仍会出错。对于只展示一种统计量且上下文明确的内部仪表盘,标注可以简化为图注里的一句话;对于混合展示多种统计量的系统,每个图表独立标注不可省略。误差棒之外的区间表达(如区间带、小提琴图)同样需要标注——语义标注的问题不是误差棒特有的。

怎么落地

  • 每个含误差棒的图表在图注、悬浮提示或轴标签中注明误差棒代表的统计量(如"95% CI"或"±1 SD")。
  • 优先标注置信区间而非标准差:面向决策的图表需要的是"真实值可能在哪里",标准差回答的是另一个问题。
  • 建立团队约定:仪表盘系统级设定默认区间类型,所有图表一致,只在偏离时额外标注。
  • 验证:抽 5 个含误差棒的图表,遮住图注后请统计背景的同事判断误差棒含义;判断与实际不符的图表数超过 0 即标注不足。

延伸

  • 同组U8.02.2 两组区间重叠并不等于差异不显著 · U8.02.3 区间宽度随样本量变化,需同时给出样本量 · U8.02.4 渐变带比单一硬边界的区间更少造成确定性错觉 · U8.02.5 区间的视觉宽度受纵轴标度影响,不可跨图比较
  • 相邻U8.01.2 误差棒与区间带是基本手段 · U8.01.3 未标注不确定性等于宣称确定
  • 站内检索error bar semantics · confidence interval annotation · SD vs SE vs CI

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/U8.02.1