错误分散在正确内容之中时,核查必须逐句进行,成本接近自己重写
别名: 掺沙错误 · 逐句核验 · needle in correct prose
概念解释
一份产品说明,九段机制都对,第三段中间把竞品型号写成了已停产的那一款。抽查开头和结尾会漏掉它;通读「感觉没问题」也会漏掉它。错误不是整篇假,是嵌在真里面的一句。掺沙式错误(scattered-error checking)要求核验按句进行——成本于是接近把全文重写一遍,因为每一句都可能是那粒沙。
整篇劳动是否划算是另一笔账。这里说的是错误的空间分布如何逼出逐句扫描。
机制
人的核验默认是抽样:读开头、扫标题、抽一两个数字。这个策略假设错误会成团出现,或会搞坏全局连贯。生成错误经常不服从这个假设:局部连贯仍然成立,错的只是一个槽位(型号、剂量、条款号)。抽样的期望检出随错误分散而下降;要达到可接受的漏检率,抽样必须加密到接近全检。
全检没有写作时的生成性记忆,每一句都是新的判断。于是「大部分是对的」不但不降低成本,还提高漏检:对的句子把核验者的警惕磨低,下一句错的更不容易被当成嫌疑。
怎么研究
构造文本:错误率固定(例如 5% 的事实槽位),操纵聚集 vs. 均匀分散。允许抽查或要求逐句。因变量:漏检率、核验时间、核验者自报信心。自变量:错误聚集程度、对的句子是否高流畅、是否提供逐句核对界面。
报告「信心 × 漏检」。分散条件下常见高信心高漏检——正是抽样策略被「大部分是对的」骗到的签名。
边界
错误若破坏全局结构(章节对不上、表格合计不平),抽样就能发现,不必逐句。有机器可检的槽位(型号对照目录、校验和、编译)可以把全检交给程序,人只看程序标出的句。纯文体润色几乎没有事实槽,逐句事实核验是错的工具。极短文本(两三句)谈不上分散,整篇就是全检窗口。这条不处理核验者缺领域知识时根本看不出错。
怎么落地
- 对事实槽位提供逐句或逐字段核对,不要只给「全文看起来是否合理」的确认。
- 把可机器对照的槽(型号、条款号、金额、日期)自动标成待核,而不是埋在段落里等抽样。
- 不要用「总体正确率高」当作可以抽查的理由。正确率高且错误分散时,抽查最差。
- 验证:在一篇 95% 正确、错误均匀埋入的文本上,让目标用户按他们平时的方式核验,再逐句对照金标准。漏掉的每一处都说明抽样已经不够,界面还没把核验降到字段级。
延伸
- 同组:L3.03.1 流畅表述不等于正确 · L3.03.2 核查成本可能高于自行完成 · L3.03.3 高后果场景不应把核查完全交给用户 · L3.03.5 用户越不熟悉某领域越难核查,而这正是最可能求助系统的场景 · L3.03.6 表述的确定语气与内容的可靠程度之间没有关系 · L3.03.7 数字、日期与人名一类具体细节的错误最难察觉且后果最大 · L3.03.8 把核查责任写进免责声明并不减少错误的实际传播
- 相邻:L3.02 来源标注 · L3.08 生成结果的来源标注
- 站内检索:
scattered-error checking·sentence-level verification·mixed correct and false