Z2.03.1Asymmetric costs of misses and false alarms设计研究

两类错误的代价通常不对称

别名: 误报与漏报 · Type I / Type II error · false positive / false negative

概念解释

任何检测系统犯两类错误:误报(false positive,没有事件却报了)与漏报(false negative,有事件却没报)。同一个阈值下,压低一类必然抬高另一类——这是数学关系,没有两头都低的调法。设计的关键认识是:两类的代价几乎从不对称。安防漏报 = 入侵未被察觉,误报 = 走过去看一眼;烟雾报警漏报 = 火灾,误报 = 吵一场。设计检测功能的第一件事不是调参数,而是回答:哪一类错误更贵。

把「检出率最大化」当目标函数,等于隐式宣布漏报无穷贵、误报免费——两个都站不住。

机制

不对称的三个来源:

  • 后果量级不同:漏掉的常是安全与机会(入侵、跌倒、泄漏),误报的多是便利(一次多余的查看)——但也存在反向场景(误报的社交尴尬、深夜吵醒全家)。
  • 后果承担者不同:漏报的代价多由用户承担,误报的代价常由系统形象承担(「这东西老乱响」)——产品决策因此系统性偏向压误报,即使用户利益方向相反。
  • 可修复性不同:误报当场可澄清(「没事,误触」),漏报的事错过就错过,事后无从补救——时间不可逆把漏报的单次代价放大。

用户适应会放大初始的不对称:重复误报训练用户忽略告警——狼来了效应,护理与航空领域的警报疲劳(alarm fatigue)文献充分记录了这个过程。此时名义上的检测系统实际保护力趋零:阈值压误报压过头,最终买到的是系统性漏报。

怎么研究

  • 信号检测论:把检测性能拆为敏感度(d′,真本事)与反应偏向(β/准则,工作点选择)两个独立参数——标准框架(Green 与 Swets 的经典工作奠定)。它证明了一件对设计最重要的事:阈值调的是 β 不是 d′,抱怨「不准」与抱怨「太敏感」要分开诊断。
  • ROC 分析:画出全阈值范围的两类错误率曲线,选工作点前先看曲线形状——曲线下的面积告诉你这个传感器值得调到多细。
  • 警报疲劳研究:医疗警报管理文献量化了告警量与响应率的关系(响应率随告警量上升单调下降),为「误报的真实代价包括未来的漏报」提供了证据。

方法论注意点:漏报在自然使用中不可观察(没报的事件用户不知道发生过),实测必须靠注入事件或事后标注;只统计误报的评估会系统性高估系统表现。

边界

  • 代价比随场景与时间漂移。 白天误报便宜(人在家),深夜贵(吵醒人);「平均误报代价」掩盖了这个分布,分时定价的分时阈值才是对的颗粒度。
  • 主观抱怨不是代价的无偏估计。 误报被高估——它被体验到、被记住;漏报被低估——它沉默无感。把用户抱怨直接当代价比,会系统性偏向压误报。
  • 对「两类都致命」的场景无解可调。 这种系统的问题不在阈值在敏感度——换模态、加融合,ROC 曲线本身要动。

怎么落地

  • 为每个检测功能写两行代价说明:「漏报时发生什么 / 误报时发生什么」,各写具体后果,据此定阈值方向——这是产品决策不是调参。
  • 监控上线后两类错误的实际比率与用户的告警忽略率,忽略率上升是警报疲劳的前兆。
  • 代价随时段变化的场景用分时阈值:深夜偏向不扰民,但安全类(烟火、跌倒)反向——深夜正是漏报最贵的时候。
  • 验证办法:分别统计两类错误的事后比率(误报靠用户反馈,漏报靠注入事件回测),与设计时的代价假设比对;两个数都要看,只看误报率等于默认漏报免费。

延伸

  • 同组Z2.03.2 阈值设定是产品决定 · Z2.03.3 用户需能调整敏感度
  • 相邻Z2.02 推断的不确定性 · Z2.01.1 每种传感器有明确的失效条件
  • 站内检索false positive · false negative · signal detection theory · alarm fatigue

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/Z2.03.1