M2.07.3flowchart is not utterance evidence设计研究

流程图不能替代真实语料验证

别名: 语料验证流程 · paper flow · 流程图幻觉

概念解释

流程图上的箭头写的是用户行为类型(「提供目的地」),耳朵里进来的是句子(「去我妈那儿,就是上次那个小区,叫什么来着」)。图可以保证节点有进出,不能保证这句话能触发那条箭。用图画完流程就开工,等于用类型标签代替了真实话语。验证对象是话,不是框。

机制

图把口语压缩成事件名,压缩掉的是停顿、改口、指代、一次说多槽、以及根本不在词表里的说法。识别和理解的工作全发生在「句子 → 事件」这一跳;图假设这一跳已经成功。设计走查时大家对着框点头,是因为框是他们自己写的语言,不是用户的语言。

现场第一句尤其偏离图。用户按自己的任务模型开口,不按槽位顺序,也不按「请说出日期」的提示语法。若第一句无法落到任何一条箭上,后面画得多完整都不会被走到。图还暗示互斥分支(选了日期就不会同时改地点),真实句子经常一件事没说完就插进另一件。

怎么研究

在图锁定之前收集目标用户的自发首句:只给任务目标,不给提示语示例,每人至少一条。标注每句能否唯一映射到图上的一条用户侧箭。因变量是可映射率、一句多事件的比例、以及含改口/指代而图上没有对应处理的比例。

上线后用日志做同样的映射:抽每个用户侧箭头上的真实句子,看 NLU 是否打到该箭所假设的意图。Wizard-of-Oz 让人完成任务但不让他们看见流程图,对照图上的「用户将提供 X」是否出现。不要用内部走查代替:走查验证的是图的自洽,不是句子的覆盖。

边界

按键菜单(「请按 1」)的用户侧事件就是按键,图和接口几乎同位,语料验证的优先级下降。受过训练的话务员会主动靠近提示语法,图的预测会准一些。图作为内部沟通仍然有用,它失败的是当验收证据。槽位很少、词表封闭的技能(开/关一盏灯)句子变化小,图的伤害也小。已经有大量日志之后,图可以改写成对语料的摘要,那是反过来用数据约束图,不是用图代替数据。

怎么落地

  • 每条用户侧箭头底下贴至少五句真实说法,必须包括:干净的填槽、含糊指代、中途改口、「我不知道」、一次说出图上后几步的内容。贴不出五句,箭头就还是愿望。
  • 第一句单独建一套语料,不要从系统问句倒推用户会怎么答。
  • 评审时先听录音或读句子,再看图;图上走得通但句子落不进 NLU,按未覆盖处理。
  • 验证:用未参与画图的人做任务,把他们的每句对到图上。对不上的句子列成缺口,改的是理解或分支,不是再把框画漂亮。

延伸

  • 同组M2.07.1 流程需覆盖成功、失败与中途退出 · M2.07.2 每个状态都需要退出路径 · M2.07.4 槽位填充顺序应允许乱序 · M2.07.5 取消、重来与帮助在任何状态下可用 · M2.07.6 状态数量增长会超出可测试范围
  • 相邻C7.14 命令语法与自由表达 · M2.02 开放式与封闭式提问 · M1.06 修复策略
  • 站内检索utterance validation · dialogue flowchart · first-utterance corpus

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/M2.07.3