需报告效应量与置信区间
别名: 效应量 · 置信区间 · estimation reporting
概念解释
定量结果若只给出 p 值或“显著/不显著”,读者无法知道差异有多大、估计有多稳。完整报告需要效应量(effect size)和置信区间(confidence interval):前者用有单位或可比较的尺度说出幅度,后者给出与数据相容的幅度范围。没有这两项,显著与否无法被翻译成要不要改、改给谁看、风险有多大。这里要求的是报告规范,不是对区间宽度或检验哲学的单独解释。
机制
p 值把幅度、变异和样本量压成一个尾概率,信息不可逆。同样的 p 可以来自大效应加小样本,或小效应加大样本。效应量把幅度从检验里拆出来,用原始单位(转化率差、秒、成功人数)或标准化度量呈现。区间则展示估计的不确定范围,使“点估计是 2%”和“区间从伤害 1% 到获益 5%”被分开阅读。省略这两者,决策者只能对一个二进制标签做文章,并在复述时把“显著”听成“很大”。
怎么研究
预注册要写清效应量的尺度:绝对差、相对差、标准化系数或人数,以及区间的覆盖率和对应模型。主要结果用一句话同时给出点估计、区间和样本依据;p 值若出现,只能作为附属。多种合理尺度并存时(相对提升对低基线很夸张),同时报告绝对差。图比表更不易藏区间:用点加误差,而不是只标星号。复现包应能从同一模型重新算出效应量与区间,而不是只复现显著结论。
边界
区间的覆盖性质依赖模型:错误的独立假设、未校正的聚类、选择性报告被检验的指标,都会让名义区间过窄。标准化效应量方便跨研究比较,却会把业务上不可交换的结果强行对齐,界面决策通常更需要原始单位。贝叶斯区间或自助区间可以替代经典置信区间,但不能替代“报告幅度与不确定范围”这一要求。探索性切片上的区间若未声明多重性,不得当作确证。
怎么落地
- 把结果模板改成:点估计 + 区间 + 样本与单位;显著与否不得单独出现在摘要第一句。
- 事先选定主效应的表达单位,避免事后在绝对差和相对差之间挑选更好看的那个。
- 评审时若材料没有区间,退回补齐后再讨论是否改动。
- 验证:遮住 p 值,只留效应量和区间,决策是否仍能做;若不能,说明报告仍绑在显著标签上。