Q6.12.2Alert fatigue from tight thresholds设计研究
告警阈值过严会导致误报频发进而被忽略
别名: 告警疲劳 · false alarm fatigue · 阈值过严
概念解释
把告警线设得紧,几乎每天都会响。响多了,值班的人学会延迟打开、批量关闭、或把通道静音。这是过严阈值造成的告警疲劳(alert fatigue from tight thresholds)。疲劳一旦形成,真异常也走同一条被忽略的通道。过严不是谨慎,而是把告警从“例外信号”变成背景噪声。
机制
人的响应预算是有限的。每条告警都要占用打开、判断、记录的时间;当其中绝大多数事后被标成波动,打开的期望价值下降,延迟成为理性策略。系统设计常在事故后把阈值收紧“以免再漏”,于是误报上升,响应再下降,漏报以另一种形式回来:不是阈值太宽没响,而是响了没人当回事。体验指标尤其容易过严,因为它们比崩溃更吵、更有星期模式,却常被套用基础设施那种分钟级硬阈。疲劳还会污染文化:被反复空跑的渠道会失去政治地位,以后连合理的告警也请不进例会。
怎么研究
统计每条告警规则的日均触发、被打开时延、被标为误报的比例、以及在已确认事故里是否被及时处理。误报高且时延随周上升,就是疲劳在形成。回放事故:收紧阈值前后,检出时间是否真的缩短,还是只增加了关闭次数。也可以做通道实验:把低价值规则移出即时通道,看高价值规则的打开时延是否下降。
边界
生命安全和资金类失败可以接受更高误报,因为漏报代价不对称;即使如此,也应分通道,以免把它们埋进体验波动里。过宽的阈值是另一端的错误,不能用反疲劳当借口关掉关键规则。疲劳有时来自告警文案不可读,而不是阈值本身,改文案可能比改线更有效。自动化关闭“重复告警”要小心把同一根因的持续异常一并关掉。
怎么落地
- 为每条规则设定可调查的日均上限;超过则先加宽或拆分,而不是要求人更快关单。
- 事故后复盘漏报原因,禁止默认把线收紧一档作为唯一整改。
- 即时通道只留高代价失败;体验波动走日摘要,不进半夜呼叫。
- 每周公布误报率和打开时延,时延上升视为通道健康恶化,与漏报同等处理。