M4.09.1child speech dual deviation from adult norms设计研究

儿童的声学与语法同时偏离成人常态

别名: 儿童语音双偏离 · 声道与句法 · pediatric ASR

概念解释

儿童的话对成人模型来说不是「说得不太清楚」这一件事。它同时离开两条常态:声学——基频更高、共振峰按更短声道缩放、辅音尚未发稳;语法——电报句、自造词、语序和形态都还在发育。成人识别器把成人声学模型与成人语言模型捆在一起。单边偏离已经够伤,两边一起偏离会互相放大。这里要讲的是双重偏离怎么叠,不是「儿童词错误率更高」这句统计,也不是总体指标会把谁藏起来。

机制

声学侧,儿童的声道短,共振峰上移,成人梅尔滤波器组看到的是一套被拉高的音色;未完成的构音(把 /s/ 发成 /θ/、省略复辅音)在成人音素表里没有稳定的对应,解码器只能拿最近的成人音素去填。语法侧,语言模型的先验来自成人书面和口语:它期待「请把楼上的灯打开」,不期待「灯灯上面开开」。声学已经把概率质量推到错误的词格子上时,语言模型不但不往回拉,还会把电报句改写成它熟悉的成人句子,于是出现「听成了另一句完整的大人话」。两条误差不是相加:声学误匹配提高了错误候选的似然,成人语法先验再把那些候选收成合法成人句。五岁和十二岁也不在同一点上——声道和句法都在变,把「儿童」当成一个桶会把双重偏离平均掉。

怎么研究

把适应拆开:只适应声学只适应语言两边都适应,在同一批儿童话语上看三类替换——音近成人词、被改写成成人句法的电报句、两头都不靠的崩溃。儿童语料(课堂对话、故事复述,而不是念词表)才能引出语法偏离;念词表只会看到声学。按年龄分层,不要把学龄前和少年并进一个「儿童」平均。

错误分析要听原文,不要只看词错误率。同一句「灯灯上面开开」若被写成「等等上面看看」,那是声学;若被写成「请把上面的灯打开」,那是语言模型在替儿童把句子变成人。两种修法完全不同。

边界

接近变声后的少年,声学偏离缩小,语法可能已经接近成人,双重机制用不上,剩下的更像口音或语速。儿童对设备使用高度公式化的短命令(「打开灯」每天二十次)时,语法偏离被命令词表挡住,主要剩下声学。双语家庭里儿童的语码混用是第三条偏离,不能全部记在「发育中的句法」账上。成人对儿童说话时的娃娃腔,会把成人声学也拉歪,那是输入侧的另一件事。

怎么落地

  • 儿童会用的技能,声学模型和语言先验都要有儿童数据;只换一套更高音调的合成音,识别侧的双重偏离还在。
  • 对电报句不要用成人完整句去「纠正后执行」。先按儿童句法解析,执行前用他们自己的词复述:「开楼上的灯,对吗?」
  • 年龄分段:学龄前、小学、少年分开看失败,不要用一个「儿童模式」覆盖十年发育。
  • 验证:抽真实儿童请求,标失败是音近还是被改写成了大人句。后一类占头,就不是「再让孩子说清楚」能修的,是语言模型在改写。

延伸

  • 同组M4.09.2 老人的语速与停顿会触发过早的话轮判定 · M4.09.3 训练数据缺口无法靠提示语弥补
  • 相邻M4.04 人群识别差异 · C7.04 口音、方言与语言混用 · C7.03 识别错误的类型
  • 站内检索child ASR · dual deviation · pediatric language model

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/M4.09.1