C7.04.3ASR accuracy gaps as exclusion设计研究
识别率差异构成对特定人群的排除
别名: 识别不公平 · speech equity · 可用性排除 · disparate WER
概念解释
当某一群体的识别错误率高到任务经常完不成,语音就不再是通用通道,而是对那群人的排除。排除不必来自明确的拒绝名单:默认只听标准口音、只接受标准词,效果等于把另一些说话人关在功能门外。这里的问题不是“还可以再准一点”,而是谁被允许用这条输入路径完成同等任务。
机制
产品把语音设成主路径或唯一免手路径之后,WER 的人群差会变成完成率的人群差。开车、烹饪、视力障碍场景里,被排除的人没有等价的键盘可以退回去。反复失败还会改变行为:改用更“标准”的发音、放弃语音、或把设备让给家里口音更近训练集的人。于是日志里成功用户进一步偏向已经被覆盖的群体,差距自我加强。排除因此是交互后果,不只是模型指标:同样的按钮,一部分人一说就成,另一部分人永远在重说。
怎么研究
把任务完成——而不只是 WER——按群体分层:成功提交、重试次数、放弃率、是否改走其他通道。现场研究应包括方言使用者和口音与广告腔差距大的说话人,而不是只测“会说普通话的同事”。对比有无备用通道时的排除强度。伦理上要避免把被试的失败展示成娱乐,并在知情同意里说明录音用途。实验室里把所有人都调教成标准发音,会把排除测没。
边界
偶尔的识别失败不是排除;排除要求差距稳定、且挡住关键任务。自愿的风格选择(故意用戏腔)与无法改变的口音、年龄相关嗓音不同。若产品从未宣称支持某方言,应在能力边界上说清,而不是在营销里写成“会听人说话”。把排除只写成公关风险,会忽略它首先是完不成任务。
怎么落地
- 语音若是完成关键任务的路径,必须有不依赖该识别器的等价路径,直到缺口群体的完成率接近主流。
- 发布说明写清支持的语言与变体,未覆盖的口音不要暗示“说得慢一点就行”。
- 监控按口音或地区切片的放弃率;放弃升高时当作可用性事故,而不是用户不会用。
延伸
- 同组:C7.04.1 训练数据分布决定识别率的人群差异 · C7.04.2 中英混说与方言词的识别退化 · C7.04.4 同一句话中途切换语言需要识别引擎实时判断当前语言 · C7.04.5 语言判断错误会导致后半句被强行按前一种语言的音系解码 · C7.04.6 方言与标准语共享大部分词汇但发音规则不同,容易被误识别为音近字 · C7.04.7 支持口音与方言的识别改进依赖对应人群的训练数据规模,非算法单方面可解决
- 相邻:C7.06 免提与免视场景 · C7.03 识别错误的类型
- 站内检索:
speech equity·demographic exclusion·ASR disparity