Q1.08.2Stratified sampling for heterogeneous users研究
用户群体异质时需要分层加量
别名: 分层抽样 · 异质用户 · subgroup coverage
概念解释
当用户在与研究结果相关的能力、角色、设备、经验或情境上明显异质时,应按这些分析相关分层(analytic strata)分别保证观察量,而不是把所有人混成一个总样本。所谓“加量”不是把人口标签都平均配额,而是让每个需要单独回答的问题的群体都有足够证据。若只增加人数却仍集中在最大群体,小群体的缺口不会改善。
机制
合并样本会让人数多的群体主导平均值,并可能掩盖方向相反的模式。做彼此独立的层内估计时,每层精度主要由该层资料决定,不能把总人数直接当作每层样本。层级模型可在明确可交换性、共同分布与模型形式等假设下进行部分汇聚(partial pooling),让各层共享信息;它能稳定稀疏估计,却不能替代完全缺失群体的观察。质性研究中,少数群体的机制与词汇也可能被多数主题覆盖。验证性比较应在看结果前定义分层;探索性后分组可以发现线索,但须透明标为探索,并处理多重选择与小单元不稳定。
怎么研究
从决策和因果图出发选择分层变量,明确要估计层内结果、层间差异,还是确保每类场景出现。定量研究按目标精度、预期效应与分配成本规划各层样本,分析时使用正确权重恢复总体组成;过度抽取小群体不能直接按原始比例汇总。质性研究可用配额或最大差异抽样,并分别检查每层信息充分性。报告招募不足的层和由此不能回答的问题。
边界
分层过多会产生大量小单元,使估计不稳定并增加招募成本。身份类别内部仍可能高度异质,类别也可能敏感或动态,不能用标签替代机制。若研究只关心一个明确定义且同质的任务,分层未必增加价值。层间比较需要测量等价;同一量表或成功标准在不同语言、辅助方式下含义不同,直接比较会误导。