指标需要定期审查,性能会随工艺变化而漂移
别名: 报警性能漂移 · performance monitoring
概念解释
报警性能漂移(alarm-performance drift)指的是随着工艺参数、设备状态、控制逻辑、生产配方以及组织内部职责分工发生变化,原先经过合理化评审、判定为合适的报警率、优先级分布和响应表现,会逐渐失配、不再适用于当下的实际情况。这条讨论的是"要不要以及怎么持续复核"这件事本身,均值、峰值、坏演员各自该怎么算,分别是同组另外三叶的内容。一次投运验收合格,不能被当成这套报警系统会永远保持健康的保证。
机制
报警系统和它所服务的过程其实是共同演化的:任何一处局部的工艺或控制逻辑变更,都可能改变某条报警的触发频率,也可能改变报警之间原本的级联关系;人员轮换同样会改变团队实际的响应服务能力,即使报警系统本身一行代码都没有改动。定期审查真正有用的地方,是把各项指标随时间的变化趋势,和变更记录、实际发生过的事件,以及当前的屏蔽清单放在一起对照着看,只有这样才能分清楚一次指标恶化到底是过程真的出了问题,还是仅仅因为统计口径本身发生了变化。
边界
审查的频率不应该对所有系统、所有区域都机械地套用同一个固定周期——变更特别频繁的区域、一旦出问题后果特别严重的区域,以及已经检测到明显漂移迹象的区域,理应得到更密集的复核。另外,指标数字表面上变好了也不一定是真的改善,有可能是日志系统本身出现了缺失,或者是过度抑制掉了大量报警,只看指标下降就下结论会得出错误的判断。
怎么落地
同时设定按固定周期进行的例行复核,以及由重大变更触发的临时复核这两类机制,并且给指标口径的每一次调整都打上版本号,同时定期检查数据完整性,确认日志没有出现意外缺失。每一次发现异常趋势,都要具体追溯到是哪些报警样本和哪些工艺变更共同导致了这个变化,并且用有代表性的真实场景去验证整改之后的实际响应表现,而不是只看整改后指标数字本身有没有好看一些。