P4.10.4Adding data cannot fix sampling bias设计

补充数据无法修正采集机制本身的偏斜

别名: 加量不降偏 · bias versus variance in data collection · channel-limited correction

概念解释

发现数据有偏后的本能反应是「再多采一些」,但增加数量与修正偏斜是两件不同的事:采样偏差来自采集机制对人群的系统性过滤,在同一机制下重复采集,得到的只是同一形状分布的更精确版本。统计上这是偏差与方差的区别——加量降低方差(估计更稳),偏差(估计系统性偏离真值)分毫不动。一个只在国内一线城市推广的采集渠道,采一万人与采一千万人,对农村人群的覆盖比例几乎相同;缺的不是样本量,是能触达缺席者的采集路径。

机制

偏差在机制层面有三种顽固性。渠道锁定:采集渠道的人群过滤是渠道的属性而非采样的偶然,同渠道内的扩量只是把过滤结果复制得更精细(城市 App 的千万级样本里农村用户占比依旧是个位数)。激励选择:为提量加报酬,响应的是对激励敏感的人群——恰恰是原本就过度代表的群体,补样进一步偏向他们。聚合掩盖:扩量后总体指标更好看(样本大、置信区间窄),偏斜被统计显著性掩盖,问题更难被发现——数据越多,错误的信心越足。三种机制共同指向同一结论:偏斜的修复点在采集机制(换渠道、改接入门槛、新的参与方式),不在数量。

边界

「加量无用」不是反对一切数据补充:对随机噪声导致的性能波动(方差问题),加量正是正确解法;结论仅适用于系统性偏斜。换机制补覆盖也不是即插即用——新渠道引入新的人群行为差异与新的标注质量问题,覆盖修正后往往需要重新校准模型而非简单续训。另有一种真实场景是刻意的范围收缩:明知覆盖不了的人群,通过明确的功能边界与人工兜底来处理,比强补数据更诚实,也常常更便宜。

怎么落地

  • 诊断先行:补数据前先跑一次构成审计,确认偏斜属于「量不足」还是「机制过滤」——分组占比在扩量前后基本不动,即机制问题,加量无效。
  • 修偏斜的预算投向新采集路径:进入缺席人群实际使用的渠道(非智能手机短信、社区驻点、本地语言界面),而不是在原渠道加倍投放。
  • 设定扩量止损线:同渠道补样的分组占比连续两个批次无显著变化时,冻结该渠道的进一步采集投入,把预算转投机制修复。
  • 验证:每次补充采集后重跑覆盖审计,以「目标分组占比向外部基准的收敛」为唯一通过标准——总体规模增长不构成通过证据。

延伸

  • 同组P4.10.2 采集渠道决定谁根本没有进入数据 · P4.10.3 历史数据记录的是过去的决定而非事实
  • 相邻P4.03.3 分层评估 · P4.08 环境成本与加量的关系
  • 站内检索sampling bias · bias versus variance · data augmentation limits

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/P4.10.4