领域启发式需用已知问题集回测其检出率,未回测的条目不应发布
别名: 回测 · 检出率 · 假阳性 · 盲评
概念解释
新领域条目发布前应在一组已知问题与无问题界面上回测:它能否发现应发现的问题、是否频繁误报、是否与已有条目重复。回测(retrospective validation)把启发式从"听起来合理"变成有证据的检查工具。这一条是前三条的最后一道关卡:条目从真实问题库归纳而来(第二条),写法上能被两名评估者一致判定(第三条),这两步做对了,条目依然可能在实战中表现很差——回测就是在条目正式进入清单之前补上的最后一次真实检验。
机制
领域专家凭经验写出的条目,即使措辞清晰、逻辑自洽,也有两种常见的失真:写得过宽,导致几乎任何界面都会触发,条目看起来"总能发现问题",实际上是丧失了区分能力;写得过窄,只精确匹配写条目时脑子里想着的那一个具体案例,换一个角度稍有不同的界面就完全捕捉不到。这两种失真单靠审阅条目文字本身很难发现,因为条目读起来都很合理——只有拿去真正跑一遍已知问题集和已知无问题的对照界面,才能看出它在阳性样本上命中了多少、在阴性样本上误报了多少、和已有条目重复覆盖了多少。这三个数字合在一起,才能回答"这条条目值不值得发布"这个问题,而不是靠专家的直觉判断"这条听起来应该有用"。
边界
回测集本身有偏差,通过回测不等于对未来所有情况都有效——已知问题集反映的是过去已经被观察和记录下来的失效模式,新技术、新的界面形态出现后,条目需要持续监测而不是一次回测定终身。低检出率的条目也不应该一律废弃:如果它针对的是一种后果极其严重但天然很难被观察到的失效(比如某种极端边缘条件下才会触发的安全问题),即使回测中命中率不高,也值得作为辅助审查线索保留下来,只是不适合当成硬性验收标准单独使用;相反,高误报率的条目无论听起来多么专业,都不应该进入正式验收清单,因为它会持续制造需要人工甄别的噪音,长期消耗评估者的信任和精力。样本量较小的回测结果需要如实报告不确定性,不能把小样本上偶然表现好的条目直接当成已经验证过的结论。
怎么落地
- 构建一个已知问题集,每条记录包含界面版本、支撑证据、严重度、领域类别和最终的修复结果,同时配上一组已修复或从未出问题的界面作为阴性对照。
- 让没有参与撰写候选条目的评估者进行盲评,即他们不知道哪些界面属于阳性样本、哪些属于阴性样本,记录每条候选条目的命中和误报情况,避免"知道答案"污染判断。
- 为每条候选条目计算检出、漏检、与已有条目的重复率和误报率,设定一个明确的发布门槛,未达门槛的条目降级为辅助标注或退回重新归纳。
- 验证办法:条目正式上线后持续跟踪它在真实评估中的发现情况,按季度复审,把上线后新发现的真实案例补充进已知问题集里,让回测集本身也随着领域的变化持续更新,而不是固定成一份一次性的历史快照。