C7.04.4Intra-utterance language identification设计研究

同一句话中途切换语言需要识别引擎实时判断当前语言

别名: 语种识别 · LID · code-switching · 句内切换

概念解释

句内语码转换(intra-sentential code-switching)指同一口里从一种语言切到另一种,例如前半句汉语、后半句英语。识别引擎不能等整句结束再选语言,必须在流上实时判断当前语言(language identification, LID),才能把后续帧交给对应的音系、词表和语言模型。这是解码图的路由问题,不是“这句话里夹了一个借词”。

机制

单语识别假设整段音频共享一套音素清单和一份词表。切换发生时,后半句的声学证据若仍走前一种语言的发射概率,会被拆成该语言的音节。流式系统因此在短窗上跑 LID 或使用多语共享编码器加语言后验。判断要足够快:等整句会让部分结果先以错误语言冒出来;太快又会把口音、专名和噪声当成切换。真正的切换是音系与词法一起换轨,与在汉语句里插入一个已进入词表的英文品牌名不同——后者可以仍由单语解码器加混合词表消化。

怎么研究

用标注了切换点的双语口语,测量 LID 的帧延迟、切换点附近的 WER、以及语言标签准确率。脚本应包含早切、晚切、来回切,以及不切换的对照。因变量分开报切换点前、后的错误,避免整句 WER 把路由失败稀释掉。演员按提示在固定位置切换,生态效度低于自然双语对话;至少要有一组不按脚本的会话。

边界

用户在系统设置里锁死一种语言时,不应再做实时 LID,否则会把口音判成外语。两种语言声学很近(部分方言与标准语)时,LID 窗口会抖,那更接近变体识别而不是语种识别。书面翻译腔的“中英各半”朗读,切换点干净,会高估现场效果。没有多语解码图的产品谈实时判断没有工程对象。

怎么落地

  • 对明确支持双语口令的场景,在流式解码里跑语言后验,并允许在一次采集中途换轨。
  • 把当前判定的语言做成可见状态(例如正在出的文字脚本),切错时用户能立刻改语言而不是整句重来。
  • 回归集必须包含句中切换,而不是只测“整句英语”和“整句汉语”两条。

延伸

  • 同组C7.04.1 训练数据分布决定识别率的人群差异 · C7.04.2 中英混说与方言词的识别退化 · C7.04.3 识别率差异构成对特定人群的排除 · C7.04.5 语言判断错误会导致后半句被强行按前一种语言的音系解码 · C7.04.6 方言与标准语共享大部分词汇但发音规则不同,容易被误识别为音近字 · C7.04.7 支持口音与方言的识别改进依赖对应人群的训练数据规模,非算法单方面可解决
  • 相邻C7.10 部分结果的实时显示 · C7.14 命令语法与自由表达
  • 站内检索language identification · code-switching · intra-utterance LID

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/C7.04.4