U8.02.3Interval width varies with sample size; sample size must accompany it设计

区间宽度随样本量变化,需同时给出样本量

别名: 样本量标注 · 区间宽度解读

概念解释

置信区间的宽度不是数据的固有属性,而是样本量的函数:同样均值和方差的数据,样本量从 30 增加到 3000,95% 置信区间宽度缩小约 10 倍(宽度与 √n 成反比)。因此,图表上看到的"窄区间"可能反映的是真实的小方差,也可能只是样本量大;"宽区间"可能反映数据本身波动大,也可能只是样本太少。没有样本量信息,读者无法把区间宽度归因于数据特性还是收集规模——而这两种归因导出完全不同的行动(改进产品 vs 收集更多数据)。

机制

区间宽度与样本量的关系来自估计精度的数学结构:标准误 = 标准差 / √n,置信区间 ≈ 标准误 × 常数。样本量进入的是平方根——这意味着收益递减:样本量翻倍区间只缩窄到原来的 1/√2(约 71%),从 100 到 10000(百倍样本)区间只缩到十分之一。这个平方根关系决定了图表上的两个现象:其一,小样本时区间宽度对样本量极其敏感(30 → 100 样本区间缩了近一半),读者看到的宽区间可能只需要再收集一点数据就能显著收窄;其二,大样本后区间收窄的边际收益趋近于零,图表上两条几乎同样宽的区间可能对应 10 倍的样本量差异。读者需要样本量信息来判断"这个区间是数据的属性还是收集的属性",进而判断下一步该改进产品还是该积累数据。

边界

样本量不是区间宽度的唯一决定因素:方差同样影响宽度(高方差的小样本产生宽区间),所以窄区间不能直接推断大样本。区间宽度对样本量的敏感度还受置信水平影响:99% 区间天然比 95% 宽约 30%,跨图比较时如果置信水平不同,宽度的差异可能来自水平而非样本量。对于非独立样本(时间序列、聚类数据),有效样本量小于名义样本量,基于 n 计算的区间会系统性偏窄——此时同时标注名义 n 和有效 n 更诚实。当图表展示的是比率或比例时,区间宽度还受基础率影响(接近 0% 或 100% 的比率天然区间更窄),样本量的解读需要配合基础率。

怎么落地

  • 每个含置信区间的图表在标签、悬浮提示或图注中同时给出样本量 n。
  • 分组对比图表中各组样本量差异超过 2 倍时,用条形或数字显式标出各组 n,避免读者把宽度差异全部归因于数据波动。
  • 在组内样本量极不均衡的图表上(如某组 n=5,其余 n=1000),对极小样本组额外标注"样本不足"。
  • 验证:请一位读者解读图表上某组的窄区间是"数据稳定"还是"样本大";如果读者无法判断因为图上没有 n,即样本量标注缺失。

延伸

  • 同组U8.02.1 误差棒代表标准差、标准误还是置信区间必须标明 · U8.02.2 两组区间重叠并不等于差异不显著 · U8.02.4 渐变带比单一硬边界的区间更少造成确定性错觉 · U8.02.5 区间的视觉宽度受纵轴标度影响,不可跨图比较
  • 相邻U8.01.1 点估计隐藏了区间信息 · U10.04.4 检查不确定性、缺失比例与样本量是否已标注
  • 站内检索sample size annotation · interval width · standard error scaling

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/U8.02.3