罕见故障恰在监控最弱时发生
别名: 自满窗口期故障 · complacency-shaped failure · 最不盯的时候出错
概念解释
故障的时间分布并不均匀地落在人盯得最紧的时候。可靠自动化把故障推稀之后,剩下的那几次往往落在监控已经被安静训练得最松的时刻。罕见故障打在最弱监控上(rare failure at weakest monitoring)说的是时间对齐:不是「故障很难」,是「故障到来时人刚好不在岗」。
设计若只按平均监控强度来估检出率,会把这个对齐漏掉。
机制
安静时段拉长,采样间隔拉长,人对自动化通道的情境模型也在过期。Endsley 讲的回路外(out of the loop)不是人离开了座位,是情境意识的三层——知觉、理解、预测——都没有被新数据喂着。故障在这一刻出现,人要先重建「现在是什么」,才能判断「这是不是坏了」。重建时间叠在检出时间上,而产品的告警预算常常只按「信号是否亮了」来算。
更糟的是,自满最深的时刻,人往往正在把注意交给另一件有反馈的事。故障与那件事抢同一条注意通道。
怎么研究
把故障插在可靠时段的早期、中期、晚期,比较检出时延和漏报。自变量:插入点距上一次可见事件的时间、插入时第二任务是否正处高峰、告警是否打断。因变量:从故障发生到人做出正确干预的时间、干预是否基于重建后的理解还是基于「灯亮了就按」。
要记录故障发生前最后一次真实采样的时间戳。检出时延对「距上次采样」回归,比只报平均检出率更能露出对齐效应。
边界
故障若自己带强中断(物理急停、全屏模态),对齐效应会被打断压住,但打断只解决知觉,不解决理解。极高频故障会阻止自满形成,这条的前提不成立。技能退化是另一条曲线:人即使在看,也可能已经不会做。这里只处理「没在看」与「故障到来」的相遇。
怎么落地
- 评估检出率时不要取全时段平均,要单列「长安静之后的第一次故障」。过不了这一列,就不能声称监控有效。
- 长安静之后的第一次异常,告警要按「人需要重建情境」来设计,而不是按「灯亮一下」。给当前状态摘要,不只给一个红点。
- 验证:在预发把故障安排在你们最长的无事件窗口末尾,看从发生到正确干预的时间。若这个时间显著长于班次开始后不久的同款故障,对齐已经在发生。