Q3.13.2Large samples make trivial differences significant设计研究
大样本会让微小差异显著
别名: 大样本显著 · 微小效应 · excess power
概念解释
假设检验的灵敏度随有效样本量上升。流量足够大时,转化率相差零点几个百分点、完成时间相差零点几秒,也可以跨过常用显著阈值。这种显著只说明估计很精确,不说明差异对用户或业务重要。大样本把“能分辨”和“值得关心”彻底拆开:越容易显著,越不能用显著代替幅度判断。
机制
标准误大致随独立观察数的平方根下降。均值差或比率差只要稳定地不等于零,样本足够大时检验就会拒绝。界面日志、全量实验和长窗口观察很容易跨过这个门槛。于是真实但琐碎的差异——多一次无意义点击、标题词序对阅读时间的毫秒级影响——获得与严重障碍相同的“显著”标签。标签的信息量在大样本下趋近于“方向大概不是零”,对行动几乎没有增量。
怎么研究
先按最小关心的效应规划精度,而不是追求无限显著。报告时把样本量和标准误与效应放在一起,使读者能看出显著来自幅度还是来自 N。对已经大得过分的样本,预先声明:小于行动阈值的效应即使显著也标为琐碎,不进入主结论。可用等效性或最小效应检验,主动问“能否拒绝效应小到不值得管”,而不是只问“能否拒绝为零”。按会话而非按事件分析时,先处理聚类,避免把相关点击当成独立样本进一步抬高灵敏度。
边界
安全关键或公平性场景里,稳定的微小伤害累加起来可以变得不可接受,不能因为单次效应小就忽略;但论证应走累积风险,而不是“已经显著所以必须改文案”。小样本研究不会出现这个问题,它们的麻烦是方向都不稳。当效应本身随样本构成变化(高峰时段与低谷时段混在一起),大 N 显著的是混合总体的一个平均值,可能谁的体验都不代表。
怎么落地
- 在实验文档里写明:小于某幅度的差异,无论是否显著,都不作为改版理由。
- 大流量试验的结果摘要以幅度和区间为首行,显著与否放在注释。
- 发现“显著但幅度低于事先阈值”时,结案为琐碎差异,不要为了消化显著结果去改界面。
- 验证:把样本量缩到原来的十分之一做敏感性重算;若结论从“必须改”变成“看不清”,说明原结论绑在了 N 上而不是绑在幅度上。