随机分流保证可因果推断
别名: 随机分流 · A/B 因果 · 随机分配
概念解释
A/B 测试把用户(或会话、账户)随机分配到现有方案 A 或 B,再比较事先规定的结果。随机分流的作用不是“更公平地展示新功能”,而是在期望上平衡已观察和未观察的混杂——同时期的营销、季节、自我选择爱尝新的人——从而使组间结果差可以归因于方案差。没有随机,先点进新版的人往往本就更活跃,观测到的提升可以全部来自人群而非界面。因果推断在这里依附的是分配机制,不是事后用模型“控制几个变量”。
机制
每个单位以已知概率进入一臂,长期看两臂的背景特征分布收敛。未测到的性格、设备老化、隐匿的使用动机也被同一机制打散,不必把它们列进回归。这与“看起来相似的两组”不同:配对或分层只能平衡想到的维度,想不到的维度仍可偏置。随机失败则反向:若实现把新用户全分到 B,或让同一家庭的人互相看见不同版,平衡被破坏,因果链从分配处就断了。可归因的是“被分配到的方案”,不是用户最后实际用到的方案——后者已经掺进依从性。
怎么研究
在分流日志里核对:分配时刻是否早于结果窗口、各臂样本量是否与设定概率相符、关键协变量在分配后是否仍有大缺口。缺口一旦出现,先查实现(哈希盐、缓存、登录态),不要用事后匹配把实验“修成”观察研究。结果比较针对分配臂(意向处理),并把未打开新版的人留在原臂。预注册主结果,避免从许多指标里挑一个显著的再回头讲因果。
边界
单位之间互相影响时(共享账号、社交推荐、限量库存),一臂的处理会漏进另一臂,随机不再把干扰隔开。关闭实验后全体用户都看见胜出方案,历史对照不能当成第二轮随机。把自然流量里“用了新功能的人”和“没用的人”比较,即使两边人数接近,也不是随机分流。随机保证的是内部因果,不自动保证换一个国家或下一个季度仍然成立。
怎么落地
- 上线前用分配日志做一次空转:确认概率、去重和“先分配后计结果”。
- 主结果按分配臂统计;把“实际看到 B 的人”单独作为依从描述,不替代主比较。
- 发现某个人群几乎只在一臂,停止读因果,先修分流再重跑。
- 报告写明随机单位和结果窗口;无法说明分配发生在结果之前的数字,不当作实验结论。