Q3.18.2Randomization unit and pseudo-independence设计研究

随机分配单元需与效应发生单元一致,否则产生伪独立

别名: 伪独立 · 伪重复 · 聚类随机

概念解释

处理被随机分到哪一层,分析就必须把那一层当作独立信息的来源。家庭、课堂、会话、公司被整组赋同一处理,组内的人却被当成互不相关的样本,就会出现伪独立(pseudo-independence)或伪重复:名义样本量被放大,标准误被压小,显著变得过分容易。随机单元要与效应发生的单元对齐——干扰发生在团队协作里,就应按团队分;效果落在账户上,就不要按每一次页面浏览独立检验。这与“有没有对照臂”无关,也与产品 A/B 能不能比较已有方案无关:错的是独立假设。

机制

同一集群共享设备、社交影响、库存和未测到的背景,组内观察高度相关。随机发生在集群层时,真正的独立抽签次数等于集群数,不是人头数。把人当作独立,就是把同一抽签重复计了很多次。界面日志尤其容易踩这个坑:一次会话里的每次点击、同一账号的多天、同一企业里的多名成员,看起来像很多行,信息量却接近一行。效应若通过溢出传到对照(共享账号看见另一版),独立假设和对照纯度一起坏。校正聚类、在随机层做检验、或按设计用混合模型,是在承认抽签次数,不是在“损失样本”。

怎么研究

预先声明随机单元、分析单元和两者为何对齐。若必须在更细的层上测(人、会话),计划里写聚类标准误、组内相关的假定,以及有效样本如何从集群数推导。随机化核查针对集群,而不是针对展开后的行。仿真:在零处理、只保留观测到的聚类结构时,名义显著率是否仍接近设定的 α;超了,说明伪独立已经进了检验。报告同时给出集群数和观察行数,禁止只报行数。

边界

组内相关接近零时(完全不共享设备、不交流、不抢同一资源),按人分析的代价较小,仍应在计划里证明相关可忽略,而不是事后发现不显著就改口。个体水平随机但存在溢出时,问题变成干扰而不是伪重复,需要另一套设计(集群随机、隔离市场)。把许多页面浏览汇总到账户再分析,会丢掉时间内的结构,却能修掉一层伪独立;选择取决于效应被定义在哪一层。

怎么落地

  • 实验单第一行写随机单元(用户 / 账户 / 会话 / 团队 / 公司),分析不得细于这一层的独立假设。
  • 结果表同时列集群数与行数;只有行数的稿退回。
  • 发现按点击检验才显著、按账户不显著时,采用账户层结论,不要把点击层写进发布理由。
  • 验证:把同一账户的多行折成一行重跑;若结论翻转,原显著来自伪独立。

延伸

  • 同组Q3.18.1 没有对照组就无法区分处理效应与时间趋势 · Q3.18.3 被试内设计需要考虑顺序效应并做对抗平衡 · Q3.18.4 实验组之间的差异只有控制其他变量后才可解释为处理效应
  • 相邻Q3.04 A/B 测试 · Q3.11 日志与埋点分析
  • 站内检索unit of randomization · pseudoreplication · clustered standard error

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/Q3.18.2