L1.06.5fluent error evades degradation设计研究
最危险的是看起来正常的错误输出,它不触发任何降级机制
别名: 流畅的错 · 假成功 · undetected wrong output
概念解释
降级机制是被失败信号叫醒的。一段语法完整、语气镇定、格式正确的错——假引文、错金额、不存在的法规条款——不产生空包,不产生异常,不产生「不完整」标记。流畅的错误(fluent error)于是从降级旁边走过去,像成功一样被用掉。
它比静默的空更危险。空至少有时看起来空;这种错看起来正是用户要的那种完成态。
机制
校验器认识结构,不认识世界。JSON 能 parse、必填字段有值、语气像客服,闸门就开。事实性错误坐在字段内部,对闸门不可见。生成模型的训练目标又偏向流畅与格式服从,正好生产这种「闸门喜欢、世界不认」的对象。
人侧的检测同样弱。流畅降低怀疑,格式正确降低「再看一眼」的动机,尤其当用户不掌握该领域(这正是他们求助的原因)。于是系统检测与人的检测同时缺席,降级的整张网是空的。
怎么研究
植入世界级错误(错的数字、假的来源)但保持结构和流畅,看:有无任何降级被触发、用户检出率、外发率。再加一种带廉价世界校验的条件(回源打开、二次计算、引用解析)。因变量:机制触发、人侧检出、外发。
不要用语法错误当材料。语法错误会触发结构闸,测不到这条。
边界
封闭任务接上权威校验(库存数量对库、金额对账本、工号对目录)时,流畅错误会被闸住,这条的锋芒下降——前提是校验真的在跑,而不是「有这个服务」。开放生成、无法回源的断言,闸几乎建不成,只能降低流畅带来的信任外观,或把输出定位成必须经人核对的草稿。这条不是「错要和空、半成品分路」——那假定错已被检出。这里是检不出来的那一段。
怎么落地
- 对有世界真值的字段接独立校验,校验失败才叫降级。不要用「模型说它有把握」当校验。
- 对没有真值的输出,拿掉完成态的外观:草稿水印、禁止一键对外、强制点开的核对清单。让流畅不再等于可发送。
- 数字、日期、人名、条款号单独成块,便于抽查,不要埋进段落。
- 验证:在预发插入一条格式完美的假引文或错金额。若没有闸亮、人又把它发出去,降级体系在最贵的那种失败上是盲的。把这类 miss 当成事故,不要当成「幻觉偶发」。
延伸
- 同组:L1.06.1 失败时需回到确定性路径 · L1.06.2 降级顺序需预先定义 · L1.06.3 静默失败比明确失败更有害 · L1.06.4 失败分为无输出、错误输出与部分输出,三者需要不同的降级路径 · L1.06.6 降级到确定性路径的前提是该路径一直被维护,而非只在故障时才存在 · L1.06.7 降级需保留用户已输入的内容,让用户从头再来是最常见的降级失败 · L1.06.8 超时与限流是可预期失败,其说明方式应与模型出错区分开
- 相邻:L3.03 幻觉与事实核查负担 · L1.04 置信度呈现 · L4.02 自动化偏见
- 站内检索:
fluent error·undetected wrong output·degradation blind spot