C7.04.2Code-mixing and dialect-word degradation设计研究

中英混说与方言词的识别退化

别名: 语码混合 · code-mixing · 方言词 · 中英夹杂

概念解释

日常口语常在一句汉语里插入英文词,或把方言特有的词掺进普通话骨架。这种语码混合(code-mixing)和方言词对只按单一标准语训练的识别器是分布外输入:英文片段被当成汉语音节,方言词被改写成音近的普通话词。退化发生在词这个层级——混入的单位识别崩了——不一定等于整句换了一种语言。

机制

单语解码图的词表和语言模型几乎不含“打开 flight 模式”“给佢打电话”这类混合串。英文词的音素要走汉语音系才会被硬切成汉字;方言词若未进词表,只能落到普通话近邻。混合点附近的上下文对语言模型也是低概率,前后的标准词有时被一起带偏。这与口音把同一标准词发得不同不是一件事:这里缺的是词本身,不是同一词的发音变体。广告、产品名、程序员口语和技术支持对话里,这类混入是常态而不是噪声。

怎么研究

用受控脚本构造“纯普通话 / 插入一个英文专名 / 插入方言词 / 整句混合”四档,比较 WER 和关键词召回。英文插入应覆盖字母、数字和常见借词;方言词应来自目标地区的真实用法,而不是研究者发明的标记。因变量单独报混合片段是否被保留,而不是只报整句 WER——整句可能看起来还行,关键的那个英文产品名已经没了。不要用新闻朗读当基线来否认混说问题。

边界

有双语词表和混合语言模型的系统,对高频借词可以较稳,但对用户自造的英文缩写仍然差。纯方言整句更接近另一种语言的识别,不是“在普通话里夹一个词”。书面语输入法用户若从不混说,这条退化不会出现。把所有中英错误都归因于语言识别选错,会漏掉词表里根本没有那个英文词的情况。

怎么落地

  • 产品名、命令英文别名和地区高频方言词进入词表,并用混合句做回归,不只测纯普通话脚本。
  • 对可能被汉字吞掉的英文片段,允许用户用键盘补专名,而不是逼整句重说。
  • 上线前在目标城市收真实混说样本,按“混合片段是否还在”验收,而不是只看总体字正确率。

延伸

  • 同组C7.04.1 训练数据分布决定识别率的人群差异 · C7.04.3 识别率差异构成对特定人群的排除 · C7.04.4 同一句话中途切换语言需要识别引擎实时判断当前语言 · C7.04.5 语言判断错误会导致后半句被强行按前一种语言的音系解码 · C7.04.6 方言与标准语共享大部分词汇但发音规则不同,容易被误识别为音近字 · C7.04.7 支持口音与方言的识别改进依赖对应人群的训练数据规模,非算法单方面可解决
  • 相邻C7.03 识别错误的类型 · C7.14 命令语法与自由表达
  • 站内检索code-mixing · dialect word · mixed-language ASR

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/C7.04.2