替换、插入、删除三类错误的后果不同
别名: WER · 替换错误 · 插入错误 · 删除错误
概念解释
自动语音识别把输出和参考转写对齐后,错分三类:替换(substitution)把正确词写成别的词,插入(insertion)多出参考里没有的词,删除(deletion)丢掉说过的词。字错误率(word error rate, WER)把三类加总除以参考词数,所以同一个 WER 可以来自完全不同的破坏方式。对交互来说,三类错误碰到的槽位、否定和专名,后果并不等价。
机制
解码器在声学得分和语言模型之间折中。替换常出现在声学近邻或语言模型更“顺”的词上:把“取消”听成“查询”,意图可能反转。插入来自把噪声、呼吸或口头禅解成词,也可能来自语言型号入了上下文里高频的功能词。删除出现在轻声尾音、被噪声盖住的虚词、以及被语言模型判成多余的重复。命令式界面里,删掉一个否定词或插入一个不存在的槽值,比错一个修饰形容词更致命。意图错误(intent error)因此不能从 WER 反推:一次替换就足以把意图改掉,而三次同义词替换可能意图仍对。对齐本身也依赖分词:中文连续输出的切词不同,三类计数会跟着变。
怎么研究
在受控口令集和自发听写上分别做对齐,拆开三类错误,再按词类(否定、数字、专名、功能词)分层。同时标意图是否仍可执行。自变量包括噪声、语速、领域词表。不要只报一个 WER:画出替换/插入/删除的构成,并单独报告关键槽位的错误。实验室朗读会压低插入(少口头禅)和删除(吐字完整),夸大“识别已经可用”的印象。
边界
开放域闲聊对同义替换更宽容,导航和转账对数字与专名的替换几乎零容忍。流式部分结果里的插入可能在终态被收回,不应与最终假设的插入同等问责。说话人自己的口误不是识别错误,对齐前需要约定是否从参考里剔除。把所有失败都叫“识别不准”,会把该改语言模型偏置的替换,和该改 VAD 的插入,收进同一条优化队列。
怎么落地
- 对会改变意图的词类(否定、金额、人名、地址)单独做错误预算,不要用总体 WER 当上线门槛。
- 展示结果时,对低置信的替换给出可点选的近邻,而不是只给一整句重说。
- 日志把三类错误分开,并标注是否导致错误执行;插入突然升高时先查噪声和端点,替换升高时先查词表和语言模型偏置。