C7.01.2Wake-word phonotactics设计研究

唤醒词的音素结构决定误唤醒率

别名: 音素结构 · phonotactics · 混淆集 · 误接受

概念解释

唤醒词能否在日常语音里站得住,首先取决于它的音素结构(phonotactic structure):音素个数、音节长度、重音模式,以及它与高频词、人名、品牌名的声学距离。短、常见、与口语大量重叠的短语,会把关键词检测的误接受率抬高;更长、更稀有的音素串则相反。这里讨论的是短语作为声学模板有多容易被撞上,不是命中之后系统如何处理那次误触发。

机制

关键词检测在低功耗芯片上对短时特征做模板或小网络匹配。决策边界由正例(目标短语)和海量负例(其他语音与噪声)共同撑开。若目标只有两三个常见音节,负例空间里会有大量近邻:口语里的“小爱”“你好”类片段、电视对白、歌曲歌词都会穿过门限。增加音素数、避开该语言的高频音节组合、避免与产品名在广告中反复出现,等于把目标点移出稠密区。自定义唤醒词把选择权交给用户,同时把碰撞面从实验室词表改成不可控的个人词表:单音节昵称几乎必然与日常发音重叠。模型容量受始终在线的功耗预算限制,再深的网络也填不平一个本身就太短的模板。

怎么研究

用大规模负例音频估计每小时误接受,并按音素长度、音节数、与词表的最小编辑距离分层。混淆集(confusable set)分析列出最容易触发的真实短语。自变量还包括语速、口音和信道(手机麦克风对远场阵列)。不要只用品牌官方短语的正例召回:那会选出“好记但到处都是”的词。广告投放前后应重测,因为媒体会在负例分布里注入目标短语本身。

边界

音素再独特也挡不住有人故意说那句话,或电视里原样播出产品口号。多语言用户的家庭里,某一语言里罕见的串可能是另一语言的日常词。极短的唤醒词在噪声里更难与虚警拆开,但不等于长词在所有信道都更稳:过长会抬高漏检,老人和儿童更难一次说完整。把误触发全部归因于门限,而忽略词本身的碰撞密度,会把调参当成唯一手段。

怎么落地

  • 选词时避开该市场高频音节和正在投放的广告口号;内部用负例小时数而不是“听起来聪明”做决策。
  • 允许自定义短语时,拒绝过短或与系统命令同音的候选,并提示用户改用三音节以上的独特组合。
  • 上线后按地区和内容源监控误接受;若某条电视节目反复撞词,优先改词或加上下文约束,而不是只把门限旋钮拧死。

延伸

  • 同组C7.01.1 唤醒词是参与状态的进入条件 · C7.01.3 唤醒后的参与状态必须会过期
  • 相邻C7.08 误唤醒 · C7.04 口音、方言与语言混用
  • 站内检索phonotactics · false accept · wake-word design

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/C7.01.2