M4.04.3cohort evaluation设计研究

需按人群分别评估而非看总体指标

别名: 分群评估 · 总体 WER 掩盖 · disaggregated ASR metrics

概念解释

产品仪表盘写着「总体词错误率 8%」。开放工位上的日志里,发言的人九成落在二十五到四十五岁,儿童和老年员工的会话少,而且失败的那些根本没留下成功标记。8% 是被多数人群加权过的平均数。按人群分别评估(cohort evaluation)要求儿童、老年、青壮年各自有足够样本的 WER 和完成率,交货看最差的那一格,不看被流量稀释过的总格。总体指标可以同时为真,并对两端为假。

机制

加权平均会把稀疏、高错误的格子吃掉。设青壮年占九成流量、WER 6%,儿童占一成、WER 24%,合并接近 8%——看起来可上线,儿童格已经不可用。会话量本身还被成功率筛选:失败的人不再开口,儿童和老年的 N 进一步变小,下一周的总体更好看。所以总体指标有两层清洗:算术上的加权,行为上的退出。按人群评估把格子拆开,并规定每格的最小 N,阻止「没人用所以不用测」。没有分层,质量系统会奖励继续服务已经成功的那群人。

怎么研究

把验收改成分群报表:年龄段 × 场景(课堂、工位、车内)的 WER、句错误、完成率、N。预先写下每格的最低 N 和最高错误率,N 不够就标「未测」,不得用总体数字填进空格。对比「只看总体能否过线」与「每一格都过线」两种规则下,哪些技能会改变上线决定。开放工位的语音日志要补年龄或代理变量(设备账号类型),否则现场数据会重演加权。实验室抽样必须过采样两端,不能按自然流量抽——自然流量已经是被排除塑造过的。

边界

内部工具只有青壮年使用者、且不会卖给课堂或客房,分群可以只覆盖实际用户,仍要写明未覆盖谁。样本极小的语言或口音格子会不稳定,分群评估要求诚实的置信区间,不是伪造的精细表。把分群当成「再优化提示语就能把各格拉平」会走错方向:评估回答的是看哪一个数字,不回答用什么手段补齐。总体指标仍可用于容量和回归的粗扫描,只是不能当发布门。

怎么落地

  • 发布检查单把「总体 WER」改成「儿童 / 老年 / 青壮年 × 目标场景」的表。缺格或 N 不足视为未通过,而不是视为等于总体。
  • 日志管道保存可用来分群的字段(年龄段同意项、账号类型),并单独统计「开口后未完成」以免失败会话从分母消失。
  • 演示和商务材料若引用识别率,必须同时报两端;只报总体视为不合格引用。
  • 验证:用现有流量重算一次加权。若去掉占九成的青壮年格之后错误率翻倍,总体指标就没有资格当门,分群表要成为唯一的发布依据。

延伸

  • 同组M4.04.1 儿童与老人的语音识别率显著更低 · M4.04.2 差异构成事实上的功能排除
  • 相邻M4.09 儿童与老人的识别差异 · C7.04 口音、方言与语言混用 · M4.03 多用户识别
  • 站内检索cohort evaluation · age-stratified word error rate · disaggregated metrics

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/M4.04.3