L4.03.2rare failure at weakest monitoring设计研究

罕见故障恰在监控最弱时发生

别名: 自满窗口期故障 · complacency-shaped failure · 最不盯的时候出错

概念解释

故障的时间分布并不均匀地落在人盯得最紧的时候。可靠自动化把故障推稀之后,剩下的那几次往往落在监控已经被安静训练得最松的时刻。罕见故障打在最弱监控上(rare failure at weakest monitoring)说的是时间对齐:不是「故障很难」,是「故障到来时人刚好不在岗」。

设计若只按平均监控强度来估检出率,会把这个对齐漏掉。

机制

安静时段拉长,采样间隔拉长,人对自动化通道的情境模型也在过期。Endsley 讲的回路外(out of the loop)不是人离开了座位,是情境意识的三层——知觉、理解、预测——都没有被新数据喂着。故障在这一刻出现,人要先重建「现在是什么」,才能判断「这是不是坏了」。重建时间叠在检出时间上,而产品的告警预算常常只按「信号是否亮了」来算。

更糟的是,自满最深的时刻,人往往正在把注意交给另一件有反馈的事。故障与那件事抢同一条注意通道。

怎么研究

把故障插在可靠时段的早期、中期、晚期,比较检出时延和漏报。自变量:插入点距上一次可见事件的时间、插入时第二任务是否正处高峰、告警是否打断。因变量:从故障发生到人做出正确干预的时间、干预是否基于重建后的理解还是基于「灯亮了就按」。

要记录故障发生前最后一次真实采样的时间戳。检出时延对「距上次采样」回归,比只报平均检出率更能露出对齐效应。

边界

故障若自己带强中断(物理急停、全屏模态),对齐效应会被打断压住,但打断只解决知觉,不解决理解。极高频故障会阻止自满形成,这条的前提不成立。技能退化是另一条曲线:人即使在看,也可能已经不会做。这里只处理「没在看」与「故障到来」的相遇。

怎么落地

  • 评估检出率时不要取全时段平均,要单列「长安静之后的第一次故障」。过不了这一列,就不能声称监控有效。
  • 长安静之后的第一次异常,告警要按「人需要重建情境」来设计,而不是按「灯亮一下」。给当前状态摘要,不只给一个红点。
  • 验证:在预发把故障安排在你们最长的无事件窗口末尾,看从发生到正确干预的时间。若这个时间显著长于班次开始后不久的同款故障,对齐已经在发生。

延伸

  • 同组L4.03.1 长期无故障会降低监控强度 · L4.03.3 需要主动维持人的参与度
  • 相邻L4.04 接管与移交设计 · L4.09 技能退化 · L4.02 自动化偏见
  • 站内检索automation complacency · out-of-the-loop · time to detect

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L4.03.2