C7.04.1ASR training data distribution设计研究

训练数据分布决定识别率的人群差异

别名: 训练偏差 · demographic WER · 语料覆盖 · speaker coverage

概念解释

识别引擎对谁更准,首先取决于训练数据里听过谁。声学模型、语言模型和词表都从语料估计;说话人的口音、年龄、性别、信道和文体若在语料里稀疏,测试时的字错误率就会系统性偏高。人群差异不是解码时才出现的公平问题,而是分布问题:模型拟合的是采样到的声音,不是“所有人的声音”。

机制

监督或自监督预训练都在最小化对已见分布的预测误差。多数公开与工业语料偏向标准变体、成人、近场、朗读或播音腔。儿童声道、老年嗓音、非主流口音、电话带宽和嘈杂远场在梯度里权重更小,决策边界就围着主流说话人收紧。语言模型同样偏向书面或标准口语的词序,把另一群体常用的句法判成低概率。结果是同一套“通用”模型在不同人口切片上给出不同的 WER,即使声学硬件相同。这与某个人临时说错、或某一句恰好同音,不是同一层机制。

怎么研究

按说话人属性分层报告 WER 和意图错误,而不是只报总体均值。属性至少包括口音或方言标签、年龄段、性别、设备和信噪比。公开语音众包库可以做切片,但标签噪声大,需要与受控朗读对照。审计商业接口时,用同一脚本、同一录音条件跨群体对比,避免把内容难度和说话人属性搅在一起。只招聘校园口音的被试,会把分布问题测成“我们的模型挺准”。

边界

领域不匹配(医学词、地名)也会抬高错误率,那是词表问题,不一定是说话人覆盖。同一说话人换麦克风或换房间,信道偏移可以大过口音偏移。少样本自适应(speaker adaptation)能把个体拉回决策边界,但改变不了产品出厂时对未注册用户的默认差距。把所有差距都说成“数据不够”,会忽略解码词表和语言模型同样可以排斥某类说法。

怎么落地

  • 上线门槛按人群切片设,而不是只看加权总 WER;缺口最大的切片决定能不能当通用输入。
  • 采集与标注计划写明要覆盖的口音、年龄和信道,缺的切片优先补,而不是先堆更多标准音。
  • 对缺口人群提供不依赖这条识别路径的完成方式,直到切片误差降到可接受。

延伸

  • 同组C7.04.2 中英混说与方言词的识别退化 · C7.04.3 识别率差异构成对特定人群的排除 · C7.04.4 同一句话中途切换语言需要识别引擎实时判断当前语言 · C7.04.5 语言判断错误会导致后半句被强行按前一种语言的音系解码 · C7.04.6 方言与标准语共享大部分词汇但发音规则不同,容易被误识别为音近字 · C7.04.7 支持口音与方言的识别改进依赖对应人群的训练数据规模,非算法单方面可解决
  • 相邻C7.03 识别错误的类型 · C7.12 噪声环境下的识别退化
  • 站内检索training data distribution · demographic WER · speaker coverage

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/C7.04.1