C7.14.2Free-form speech and parse ambiguity设计研究
自由表达允许自然语言描述意图,但解析歧义显著增加
别名: 自然语言理解 · NLU · 意图歧义 · open-domain
概念解释
自由表达允许用户用自然语言描述意图,不必套固定句式。后端靠意图分类、槽位填充或大模型对齐去猜要做什么。覆盖面变宽,解析歧义显著增加:同一句话可以对着日历、消息或搜索,否定和条件更容易被丢掉。换来的是不必背口令。
机制
开放解码先产出文本,再(或同时)做语义解析。假设空间是整个语言,WER 的一次替换就可以把意图拧到另一技能。省略、指代、间接言语行为(“这儿有点冷”想关窗还是调空调)没有文法图可依。语言模型偏好通顺,可能补上用户没说的槽。与命令语法相对:那边拒识明确,这边常给出一个听起来合理却不是原意的执行。意图错误可以在 WER 很低时发生,因为句子合法、技能选错。
怎么研究
用同一批自然口语句,对比文法约束解码与开放 NLU 的意图准确率、槽位 F1、以及“合理但错”的执行。让未训练用户即兴说。标注歧义句的多种合法解释。不要只用广告脚本里的完美问句。
边界
领域很窄时,自由表达的歧义可以被领域先验压住,看起来几乎像文法。闲聊没有可执行意图,歧义的代价是答非所问而不是误操作。高代价动作若走自由表达,必须加确认,否则歧义会变成事故。口语修辞和讽刺会进一步打乱解析,实验室礼貌请求测不到。
怎么落地
- 对可能执行副作用的自由表达,先复述理解再执行,尤其是删除、支付、发给某人。
- 记录意图分布,把高频稳定意图收成文法,减少这些路径上的歧义。
- 验收放入有两种合法解释的句子,确认系统会问而不是静默选一个。