等级越高对独立性与冗余的要求越严格
别名: 硬件故障裕度 · SIL architecture
概念解释
较高的 SIL 要求安全功能具备更强的系统性能力、诊断覆盖率、硬件故障裕度(hardware fault tolerance)和经过论证的独立性,不等于简单"多加一个传感器"。两个来自同一批次、共享同一路电源和同一版本固件的传感器并联,遇到共因失效(common-cause failure)会同时失效,冗余形同虚设。
机制
增加通道数确实能让系统容忍部分随机硬件故障,但这不是免费的:多通道需要表决器(voter)判断信号是否一致,表决器本身成为新的故障点;通道越多,需要定期维护的部件也越多,维护过程本身会引入人为差错和临时旁路窗口。真正决定独立性成立与否的,是共因失效有没有被切断——电源、安装环境、软件版本、通信链路、维护人员和维护时间这几个维度,只要有一个被共享,关键时刻两个"看起来冗余"的通道就会同时失效。标准同时用架构约束(硬件故障裕度)和定量的失效概率计算限制可宣称的等级,是因为定量计算依赖对共因失效因子的估计,这个估计本身带有不确定性,架构约束相当于给这种不确定性设一个下限保险。
边界
经过大量现场验证、诊断覆盖率很高的单通道架构可能已经满足要求,不需要表面上的物理冗余;反过来,把同一套设计原封不动复制两份也不构成独立,如果两份复制品共享同一处设计缺陷,会在同一触发条件下同时失效。不能仅凭电路图上画了几条通道判断达到了哪一级,机械领域并行使用的性能等级(Performance Level, ISO 13849)体系,量化和分类方式与 SIL 不完全对应,不能直接换算。
怎么落地
先界定安全功能从输入到输出的完整链路边界,计算随机硬件失效对应的定量指标,同时单独列出电源、环境、软件、通信、人员这几条独立性维度,逐条记录证据或识别出的共享点。验证要联合注入故障——让通道故障与表决器故障同时发生、维护窗口与共享资源故障重叠,观察系统在这些组合场景下能否仍执行安全动作,而不是逐个通道单独测试。