C7.04.5Wrong-LID phonological lock-in设计研究
语言判断错误会导致后半句被强行按前一种语言的音系解码
别名: 错误语种 · language lock-in · 音系错配 · 强制解码
概念解释
一旦语言识别把当前片段标成语言 A,后续帧会走 A 的音素清单、发音词典和字符集。若用户其实已经切到语言 B,后半句仍被按 A 的音系强制解码:英语被拆成汉字,或汉语被拼成拉丁字母串。输出往往看起来像乱码或离奇同音,而不是简单的错别字。错误发生在路由锁死后,不是词表里缺某一个借词。
机制
解码图在选定语言后会剪掉其他语言的路径以省计算。声学特征被映射到该语言的发射模型,B 的音素只能投影到 A 里最近的一串。中文到英文的锁死会把整段汉语变成拼音碎片或英文近邻;英文到中文的锁死则生成一串与原文无关的汉字。流式部分结果会把这场错配尽早展示出来,终态若不再重新做 LID,错配会被提交。即使用户后半句说得很清楚,分数也可能很高——因为在错误音系内部,匹配是自洽的。这与同音替换不同:同音替换仍在正确语言的词表里选错项;这里连词表都换错了。
怎么研究
在已知切换点上人为注入错误语言标签,或用会在该点失败的 LID,对比“标签正确 / 标签锁死”的后半句转写。记录错配产出是哪一种文字系统、用户能否从文本判断“语言选错了”、以及是否会尝试重说整句。自变量包括切换点位置、两种语言的音系距离、是否允许中途改标签。不要只用 LID 准确率:准确率高仍可能在关键切换上锁死后半句。
边界
整句从未切换时,谈不上后半句被强制;那是单语识别的普通错误。允许 n-best 多语并行的系统可以在终态改判,锁死不是绝对的。极短的后半句(一个英文缩写)有时看起来像混说词表问题,需要结合是否换了音系来分。说话人带着外语口音说语言 A,LID 可能抖,但解码仍在 A 内,不属于这条锁死。
怎么落地
- 在部分结果所用文字系统突然整体切换或整段变成无法分词的汉字时,提供“改语言再解一次”而不是只给重说。
- 终态提交前若语言后验在句中途翻转,对后半句重新解码,不要把锁死的假设直接执行。
- 验收放入“前半句对、后半句文字系统错”的用例,并确认用户能在不重说前半句的情况下恢复。
延伸
- 同组:C7.04.1 训练数据分布决定识别率的人群差异 · C7.04.2 中英混说与方言词的识别退化 · C7.04.3 识别率差异构成对特定人群的排除 · C7.04.4 同一句话中途切换语言需要识别引擎实时判断当前语言 · C7.04.6 方言与标准语共享大部分词汇但发音规则不同,容易被误识别为音近字 · C7.04.7 支持口音与方言的识别改进依赖对应人群的训练数据规模,非算法单方面可解决
- 相邻:C7.10 部分结果的实时显示 · C7.03 识别错误的类型
- 站内检索:
language identification error·phonological mismatch·forced decoding