Q3.21.4Confidence-interval width as precision设计研究

置信区间的宽度比是否跨过零点更能说明估计的精度

别名: 区间宽度 · 估计精度 · 跨零不是精度

概念解释

置信区间(confidence interval)给出与数据和模型相容的效应幅度范围。区间宽不宽直接说估计有多不准;是否跨过零只是把显著性检验又说了一遍——跨过约等于未拒绝零,不跨过约等于拒绝。两个区间可以都不含零,一个从 0.1% 到 20%,一个从 4.8% 到 5.2%,精度完全不同。两个区间也可以都含零,一个紧贴在零附近,一个从大伤害跨到大获益。读区间时,宽度才是精度;跨零是检验的二进制回放。要求报告效应量和区间,是为了不让决策只剩星号;这里要读的是宽度本身。

机制

区间端点随标准误张开。独立信息少、变异大、模型把相关当成独立,都会把区间拉宽。宽区间意味着许多幅度——包括有害、琐碎和可观——仍与数据相容,点估计此时几乎不能当行动依据。窄区间把相容的幅度收紧,无论它是否碰巧把零留在外面。把“含不含零”当成唯一读法,等于扔掉长度信息,只保留与 p 阈值等价的那一比特。覆盖率还依赖模型:名义 95% 在错误独立假设下会系统性偏窄,看起来很精确,实际不准。所以宽度必须连同模型一起读,而不是当成装饰性的误差线。

怎么研究

预先规定区间的覆盖率、尺度(绝对差还是相对差)和将用于判断精度的宽度目标,例如“半宽不超过最小关心效应的一半”。主结果用一句话同时给出点估计和两端,避免先说“显著所以……”再补区间。把宽度与事先目标比较:宽于目标则结论标为不精确,不论是否跨零。图上用线段表示区间,不要只用星号。对聚类和多重性未校正的区间,注明名义宽度偏小。复现应能从同一模型重画区间,而不只是重现“跨没跨零”。

边界

贝叶斯可信区间或自助区间同样用宽度谈精度,解释换成各自的概率语句,但“不要只看是否包含零”仍然成立。标准化效应的区间方便跨研究,决策仍常需要原始单位上的宽度。等效性检验看的是区间是否落进预先的等效界,这是对宽度和位置的联合使用,不是把跨零规则换一套界。探索性切片上未声明多重性的窄区间,名义上很精确,选择性已经让覆盖率失效。

怎么落地

  • 结果第一行写点估计和两端,以及半宽;“是否含零”放在其后,不得单独做标题。
  • 预先写下可接受的最大半宽;超过则标“不够精确”,即使不含零也不发布为已证实。
  • 含零且很窄:写成“效应被精确地限制在琐碎范围”,不要写成“失败的实验”。
  • 验证:只展示区间线段、遮住含零标记和 p,决策者是否仍能区分“精确的小效应”和“什么都可能”;若不能,说明读法仍绑在跨零上。

延伸

  • 同组Q3.21.1 p 值反映数据与假设的相容程度,不是效应真实存在的概率 · Q3.21.2 检验前未做功效分析,事后无法判断样本量是否足够 · Q3.21.3 单尾检验会人为降低显著性门槛,需在实验前声明
  • 相邻Q3.13 显著性与实践意义 · Q1.08 样本量
  • 站内检索confidence interval width · precision · compatibility interval

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/Q3.21.4