正常状态需要有主动信号而非界面的沉默确认
别名: 正常状态主动指示 · positive status indication
概念解释
正常状态的主动信号(positive indication)由独立的过程状态、心跳或自检结果明确报告"系统正常且信息链路有效",而不是靠"没有报警"倒推一切正常。沉默本身是歧义的:它既可能代表真正正常,也可能代表断网、数据冻结、传感器失效或报警处理本身宕机——这几种原因在沉默这一件事上完全无法区分。
机制
无报警是缺失证据(absence of evidence),不是正常的证据,这是主动指示存在的根本理由:主动指示把"过程处于正常范围"和"监测通道本身工作正常"分开编码,只要这两件事共用同一条可能失效的链路,显示做得再明确也谈不上诊断独立性。
多数报警系统在管理理念上采用"不报警即正常"(management by exception):只在异常时打断操作员,平时保持安静,目的是减少常态噪声、避免不必要的注意力打断。这套理念能成立的前提是报警处理链路本身可信——但这个前提并不总是成立。报警服务器宕机、组态错误、网络分区、许可证过期、报警历史库写满,都会导致本该产生的报警未被生成或未被显示,而这些失效恰恰经常又是静默的,因为负责产生报警的正是那套已经失效的机制,它没有能力汇报自己的死亡。所以主动指示要回答的不是"过程有没有问题",而是更上一层的问题——"负责判断过程有没有问题的这套机制本身还活着吗",这是两个不同层级的问题,同一个报警通道回答不了第二个。
怎么研究
可用故障注入设计对比过程正常、通信中断、数据冻结、报警处理模块故障四种条件,测操作员能否正确分类,并分别记录他们对"过程状态"和"监测健康"两件事的判断准确率——这两个准确率经常不同步,操作员容易把"没看到报警"误判为"过程一定正常",即使监测本身已经失效。变量设计上要让心跳信号与被监测的过程数据在部分试次里共享同一故障点,在另一些试次里各自独立,才能测出被试是否真的把二者当作独立证据看待,还是只要看到任何绿色标签就停止怀疑。
边界
一体化传感器变送器(采集与自检共用同一颗芯片、同一路供电)无法做到真正的自检-被测分离,此时不能要求做到诊断独立,只能如实标注"自检覆盖范围有限"。开机自检(power-on self-test)通过之后,设备完全可能在运行期间发生新的故障,一次性自检结果不能代表运行期间的持续健康,只有周期性、持续运行的自检才有效,界面不应该让"已自检通过"这个标签无限期停留。新手操作员容易走向另一个极端,把"有主动指示"直接等同于"绝对没问题",这本身也是一种过度信任,主动指示的呈现需要控制这种误读,不能只给二元的正常/异常。
怎么落地
用看门狗定时器(watchdog timer)的思路设计心跳:让数据源端每隔固定周期主动写入一个递增序号或时间戳,前端如果在允许的超时窗口内没有看到序号递增,就把显示切换为"未知"而不是继续保留最后一次的绿色状态。多级架构(现场设备→RTU→SCADA→HMI)里,在每一级独立生成并转发各自的健康位,不要在最上层伪造一个笼统的"全部正常"而抹掉每一级的可追溯性。故障注入测试要专门覆盖共因故障场景:断开传感器供电的同时检查心跳信号是否也随之消失——如果二者共用同一路电源或总线,就说明现在的"独立"心跳其实并不独立,需要重新设计物理隔离。用平均故障发现时间(检测到静默失效所需的时间)作为验收指标,反复注入不同类型的故障来测量。