P4.03.2Aggregate metrics masking设计研究

总体指标掩盖子群体差异

别名: 聚合掩盖 · 总体指标陷阱 · Simpson's paradox in evaluation

概念解释

单一总体指标是按群体规模加权的平均,它会系统性掩盖子群体之间的性能差异:一个总体准确率 95% 的系统,可能对占比 80% 的人群错误率 2%、对占比 5% 的人群错误率 40%——多数人群的良好表现把少数人群的失败在平均数里稀释到不可见。极端情形下还会出现辛普森悖论式的反转:每个群体内部趋势一致,合并后方向倒转,总体指标不仅掩盖差异,还主动说谎。

机制

掩盖由三个机制叠加。其一是算术结构:加权平均对大群体敏感、对小群体钝感,占总样本 1% 的群体错误率翻倍,总体指标几乎不动。其二是优化动力学:训练以总体损失为目标,模型在「牺牲 1% 群体的性能换取多数群体 0.5% 的提升」这类交换中照单全收,因为交换在总体指标上是净收益。其三是报告惯性:团队汇报、竞品比较、验收标准都以单口径数字沟通,指标一旦成为唯一语言,未拆分的差异就没有表述的方式——不是因为难以计算,而是因为没有人要求。

怎么研究

研究上把「总体—分群体」的落差本身作为测量对象:对同一系统同时报告总体与分层指标,定义掩盖量为两者之差;用重加权分析检验辛普森式反转是否存在(分群体与合并的方向是否一致)。变量包括群体规模比、群体间性能差与总体指标的关系。方法论注意点:分层之后每格样本变小,小群体的差异检验功效不足,容易被「统计上不显著」掩盖成「没有差异」——功效分析应先于分层报告,必要时对评估集过采样以补足每格的最低样本量。

边界

并非一切场景都必须分层:与人群无关的纯工程指标(编译时间、缓存命中率)聚合无妨;分层的价值出现在「错误由人承受」的指标上。总体指标也并非无用——它回答容量与成本问题;错的是让它僭越为唯一口径。此外分层维度选错会把真差异切碎在无关维度里(按设备型号分层掩盖了语言分层的问题),维度选择要以功能对人群的实际影响为依据,而不是以数据里现成有什么为依据。

怎么落地

  • 性能仪表盘默认双口径:总体行 + 分层表并排,任何汇报只引用总体数字时自动提示分层视图。
  • 把「最差群体指标」设为一级验收项,与总体指标同屏;优化目标中加入最差群体项,阻断多数换少数的净收益交换。
  • 评估集设计时为每个分层格规定最低样本量,不足的格标「不可评估」而不是并入其他格。
  • 验证:做一次反事实核算——把上季度的总体提升拆到分层表,确认提升来自何处;若主要来自多数群体且小群体持平或下降,改进策略需要重定向。

延伸

  • 同组P4.03.1 训练数据的分布决定失败人群 · P4.03.3 需按人群分层评估
  • 相邻P4.10 数据代表性与偏见 · P4.09 算法公平与差异化影响
  • 站内检索aggregate metrics masking · Simpson's paradox · worst-group accuracy

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/P4.03.2