检验前未做功效分析,事后无法判断样本量是否足够
别名: 事前功效 · 事后功效 · 样本量事后判断
概念解释
事前功效分析(a priori power analysis)在看到结果之前,用最小关心的效应、变异、α 和设计,计算需要多少独立信息。它回答的是计划问题:这样的 n 有没有合理机会认出那个效应。结果出来之后再问“这次 n 够不够”,常用的观察功效(observed / post hoc power)几乎是 p 值的单调变换:不显著时功效看起来低,显著时看起来高,并不能额外告诉你样本缺不缺。没有事前计算,事后无法判断 n 是否足够——不是因为不能抱怨样本小,而是因为事后那个数字没有独立信息。定量研究该招多少人,由效应量规划,是另一件在开跑前做完的事。
机制
功效是“若效应等于某个事先指定的值,检验将拒绝的概率”。指定值必须来自计划,不能来自刚看到的点估计。把观察到的效应塞回公式,等于把已经决定显著与否的数据再描述一遍:p 大则观察功效低,看起来像“没测够”;p 小则观察功效高,看起来像“测够了”。于是“不显著因为 n 不够”和“显著因为 n 够了”都是同义反复。真正能说 n 不够的依据,是事前针对最小关心效应算出的目标人数与实际有效样本的差距,加上流失和聚类造成的折扣。缺少那张事前表,就只剩下对 p 的重述。
怎么研究
开跑前固定:最小关心效应、α、目标功效、设计(含聚类和主指标),输出目标 n 和敏感区间。运行中追踪有效样本(独立单元,不是展开行数),低于目标则延长或接受精度不足,而不是先看 p 再决定停不停。结果报告引用事前表,比较计划 n 与实现 n;未显著时的解释是区间有多宽、是否覆盖了关心效应,而不是观察功效。若研究开始时没有做过功效,事后可补的是精度陈述(区间宽度)和“对事先关心的效应而言信息量如何”的计算,仍不要报告观察功效当作诊断。
边界
序贯或自适应设计可以在过程中按预先规则停,那不是事后看 p 再补功效故事,停的规则必须事前写清。目标若是估计精度而不是检验,计划应直接按区间宽度求 n,功效语言可以不用,但“事前规定精度目标”这一步仍不能省。探索性、测量尚不稳的阶段,强行套两组功效公式会给出假精确的人数;应改仿真或先做测量研究。超大样本让琐碎差异显著,是另一个问题:事前功效按最小关心效应规划,本身就会拒绝为琐碎效应去堆 n。
怎么落地
- 实验单在分流前必须附事前功效或精度计算;没有附件不得开跑。
- 禁止在结果页写“观察功效只有 xx%,所以样本不够”;改写计划 n、实现 n 和区间。
- 未显著且实现 n 达到事前目标时,结案为“对关心的效应而言信息量已按计划到达”,不要加跑到显著为止。
- 验证:遮住 p,只给事前表和区间;若仍无法说出 n 够不够,说明判断还绑在观察功效上。