混淆安全等级与一般可靠性等级会导致设计不足
别名: 功能安全与可靠性 · availability versus safety
概念解释
安全完整性关心规定的安全功能在被需要时能否正确执行、且不以危险方式失效;一般可靠性关心设备在给定时间内持续提供预期功能的能力,通常用平均无故障时间(MTBF)或可用率衡量。可用率很高的设备完全可能以危险方式失效(比如报警系统持续在线却从不真正检出异常),经常安全停机的设备可用率低,但每次停机都是安全动作触发,从功能安全角度它是在正确工作。
机制
一般可靠性统计通常不区分失效方向,把"设备完全不能用"这类事件都计入故障,无论是让设备停止(安全失效)还是让设备继续运行但输出错误结果(危险失效)。功能安全必须把两者分开统计,因为只有危险失效才直接关系到风险,安全失效顶多带来停机成本。用 MTBF 这类不分方向的指标替代危险失效概率(PFD/PFH)做安全论证,等于用一个粗颗粒度的合格率掩盖了真正需要控制的危险失效数值,让人误以为"可靠就等于安全"。功能安全体系还专门控制系统性失效(设计缺陷、需求错误这类不是随机硬件老化导致的失效根源),这类失效不体现在传统随机失效率统计里,纯可靠性视角容易完全忽略。
边界
安全与可靠性并非总是对立——一次不必要的安全停机在某些工艺场景下可能诱发新的危险(如高温工艺骤停带来的热应力),这时可用性本身也变成一项安全需求,不能简单认为"越容易停机就越安全"。判断某个失效属于安全维度还是可靠性维度,前提是先有明确的安全功能定义和失效方向,离开这个前提单纯比较组件的可靠性等级或品牌参数,并不能说明其功能安全水平。
怎么落地
对每种失效模式分别标注安全后果、服务后果、能否被在线诊断检测到、以及所需的响应动作,用各自对应的指标验证——危险失效概率对应 PFD/PFH 计算,可用性对应停机时间统计,不要互相替代。评审材料应把安全完整性论证和可用性/可维护性论证分开单独报告,专门检查两类目标之间是否存在冲突,比如为提升可用性而绕过某个安全联锁。