Q3.21.1p-value as compatibility not posterior probability设计研究

p 值反映数据与假设的相容程度,不是效应真实存在的概率

别名: p 值含义 · 相容性 · 不是效应为真的概率

概念解释

p 值(p-value)是:在零假设和所用统计模型都为真时,得到当前这么极端、或更极端的统计量的概率。它度量的是数据与“假设 + 模型”这一整包的相容程度(compatibility),不是“效应真实存在的概率”,也不是“零假设为真的概率”,更不是“结果来自偶然的概率”这种口语。把 p=0.03 读成“这个改动有 97% 的可能是真的”,是把条件概率的方向接反了。显著是否值得改产品,是另一项决策,不在这一层。

机制

计算从模型里抽出统计量的尾概率,条件已经钉死:零假设成立、抽样与独立假设成立、测量按声明的方式生成。尾概率小,只说明“若这一整包为真,眼前的数据少见”。少见可以由处理引起,也可以由模型写错、异常值、相关被当成独立、未声明的多次检验引起。p 并不把这些来源拆开,更不会输出一张关于世界的后验表。要把 p 变成“效应为真的概率”,还缺先验和备择的完整规定;普通的显著性检验没有提供这些。于是同一个小 p 可以来自真效应、也可以来自坏模型,语言上却常被说成前者。

怎么研究

方法部分用定义句写 p:在何种零假设、何种模型和何种极端方向下的尾概率。禁止在摘要里把 p 改写成后验或“把握”。报告时把模型诊断(独立、聚类、分布)与 p 放在一起,使读者能看见相容性是相对于哪一包假设。用模拟在零假设下重抽,核对名义 p 是否校准;校准失败时先修模型,不要解释“效应更真了”。若需要直接谈假设为真的概率,改用显式的贝叶斯计算,并公开先验,而不是给 p 换一件后验外套。

边界

在一个已经被大量重复、模型也很熟的狭窄问题上,小 p 作为“与零模型不相容”的信号可以很有用,它仍然不是后验。探索性搜索之后未校正的 p,连相容性度量都会偏小,更不能读成真实性。等效性或最小效应检验问的是另一个假设,p 的含义跟着假设走,不是固定成“有没有效应”。教学上把 p 说成“偶然性的概率”会在沟通中反复复发,需要每次改回定义。

怎么落地

  • 结果口述模板定为:“若没有差异且模型正确,像这样或更极端的结果大约每……出现一次”,禁止说“有 ……% 可能是真的”。
  • 评审时遇到“p 小所以效应存在”的句子,退回改成相容性表述,并补模型假设。
  • 对决策者的一页纸把 p 放在脚注,正文放幅度和区间;需要概率语句时另做贝叶斯,不把 p 改名。
  • 验证:把材料里所有“为真的概率”“把握很大”圈出,能回指到 p 的句子一律删除或改写。

延伸

  • 同组Q3.21.2 检验前未做功效分析,事后无法判断样本量是否足够 · Q3.21.3 单尾检验会人为降低显著性门槛,需在实验前声明 · Q3.21.4 置信区间的宽度比是否跨过零点更能说明估计的精度
  • 相邻Q3.13 显著性与实践意义 · Q3.22 多重比较与结果挑选
  • 站内检索p-value · compatibility · posterior probability

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/Q3.21.1