M2.02.1open-prompt NLU failure设计研究

开放式提问增加理解失败率

别名: 开放式提问 · 开放域理解失败 · open-ended prompt

概念解释

开放式提问(open-ended prompt)把答语空间交给用户:展厅里的导览机器人问「您对什么感兴趣?」听起来像真人接待,下一句却可能是「那幅蓝色的」「有没有椅子」「这是什么时期」。识别器面对的是未加界的词表,意图分类面对的是未加界的行事。失败率上升不是因为开放听起来不礼貌,而是因为系统答应处理它其实覆盖不了的回答。

机制

开放式提问把两类不确定性叠在一起。声学上,语言模型的困惑度升高:用户可能说出专名、指示、闲聊、抱怨,解码路径变宽,替换和插入都增加。语义上,即使得出一串词,这些词也未必落在已标注的意图或槽上——「那幅蓝色的」要靠视线、展品列表和指代才能落地,提问本身并没有把候选收进可计算的集合。

人侧还有配合问题。开放问句在会话里意味着「你来定题」。用户会按对人的方式组织一段叙述,而不是交一个槽。叙述越长,端点、识别和意图三层都更脆弱。系统用开放句打开了合作的社交承诺,却只准备好了封闭的后端,失败就发生在这道缝上。

怎么研究

同一槽位用两种问法交叉:开放(「您想了解什么」)对有界(「要听作者、年代,还是把导览续上下一件」)。因变量分开记:词错误率、意图错误率(认对词但分错行事)、超出覆盖的回答比例、以及用户话语长度。自变量还可以包括现场有没有可见展品(有可见对象时指示语会暴涨)。

语料标注不要只标「识别对不对」。把失败拆成:声学错、意图错、槽未覆盖、指代无法绑定。开放条件若主要抬升的是后两项,问题就不在麦克风,在提问把用户领出了可解析集合。Wizard-of-Oz 若由人去理解开放回答,会系统性低估上线后的意图错误。

边界

后端真是开放域、并且有检索或人工座席接得住时,开放提问的失败不再等于任务失败,只是把理解负担移到了下一层。专家用户已经知道该交哪个槽,会把开放问句当「请说」,失败率接近封闭问。视觉共同注意可用时,「那幅蓝色的」也许能解;无屏、无位置、无展品列表时,同一句是死结。把开放问当「更自然所以更好」的默认,是在用社交自然度交换可解析性。

怎么落地

  • 只在下一层确实能消化自由文本时用开放问(检索、转人工、已经限定在当前展品)。否则改成可枚举的选择或一个具体槽。
  • 上线前用开放问收集真实答语,按意图 / 槽覆盖做缺口表;覆盖不到的高频答法,要么补覆盖,要么不要用这句开放问。
  • 开放问后面必须有退路:听不懂时不要再问一次同样的开放句。
  • 验证:对比开放条件与有界条件的意图错误和未覆盖比例。若未覆盖是主因,改问法,而不是先调声学模型。

延伸

  • 同组M2.02.2 封闭式提问限制表达但可靠 · M2.02.3 提问方式应随失败次数收窄
  • 相邻C7.14 命令语法与自由表达 · M2.04 错误恢复话术 · M1.04 上下文保持
  • 站内检索open-prompt NLU failure · open-ended prompt · intent error rate

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/M2.02.1