需按人群分层评估
别名: 分层评估 · subgroup evaluation · disaggregated evaluation
概念解释
分层评估(stratified evaluation / subgroup evaluation)指在评估开始之前就预先定义人群维度,把测试集按这些维度切分并分别报告指标,包括维度的交集(年龄 × 语言、性别 × 设备档次)。它与「事后按数据里碰巧有的字段切几刀」的区别在时序与设计:维度在评估设计阶段选定,每层保证最小样本量,交集被当作独立层而非副产品。评估的可信边界由此由设计决定,而不是由运气决定。
机制
只有预先定义的分层才会被可靠测量。事后切片依赖数据的可得性,而可得字段本身有偏(语言、设备、地区字段缺失最多的恰是边缘用户),切出来的层系统性地避开真正薄弱的人群。交集是双重薄弱点:单维统计里年长用户与低配手机用户各自可见,两者重叠的「年长且用低配手机」人群在两个单维报告里都被平均掉,而语音与界面性能的灾难恰恰常发生在这类交集上。预分层还改变了采集行为——要保证每层样本量,采集就得主动补层,等于把「哪里可能失败」的判断前置进了数据生产环节。
怎么研究
方法即评估设计本身:确定分层维度(由功能的作用机制推出:语音功能按口音与年龄、摄像头功能按光照与肤色)、每层最小样本量(按预期的效应量做功效分析)、交集层的处理(全交叉或仅预注册的关键交集)。研究文献中以「最差群体错误率」作为汇总口径,取全部分层中的最小值,逼评估面向最弱层。方法论注意点:分层使用敏感属性,评估数据需有相应治理与授权,属性缺失时的代理策略要写明并报告错分率;维度数量受样本总量约束,注册过多交集会产生空格与多重比较问题,关键交集要预先指定而非穷举。
边界
分层评估发现的是「差异在哪」,不裁决「差异多大算不公」——后者需要对照决策语境的规范判断(自动拒签与推荐排序的容忍度不同)。分层维度按国内市场设计,跨市场部署时要重新定义(种族维度在多数国家不适用,语言、部族、地域可能更相关)。样本量约束决定可行性:用户基数小的产品支撑不起多层交叉,此时应退到「单一高风险层的小样本深评」而非砍掉分层。
怎么落地
- 在评估方案模板中固定三栏:分层维度及依据、每层最小样本量、预注册的交集层;缺任何一栏方案不通过。
- 报告格式固定为完整分层表,每层附置信区间;空层标「未评」,禁止把小样本层并入邻层凑数。
- 汇总口径采用最差层指标,验收线写在最差层上;总体指标仅作参考行。
- 验证:对照上线后的真实投诉或失败案例,检查其所属层在评估表中是否本已偏弱——若是,评估的预测力正常;若问题落在当时评估良好的层,说明分层维度选漏,回到维度推导重审。