X3.07.4Conservative default under unexplainability设计研究
无法解释的决策在高风险场景中应触发保守默认行为
别名: 不可解释降级 · 保守默认 · fail-safe explanation gate
概念解释
不可解释时的保守默认(conservative default under unexplainability)是在高后果动作缺少足够输入来源、规则依据或可审计记录时,不继续按正常权限执行,而选择停止、降速、保持现状或请求授权。解释能力在这里是决策证据完整性的门槛,不是事后界面装饰。
机制
无法形成解释可能意味着感知缺失、规则冲突、模型超出验证范围或日志链断裂,这些状态都削弱了人和系统判断风险的能力。继续执行把未知当成可接受;保守策略限制可达后果,并为人工检查争取时间。默认行为需依据场景选择,因为突然停止本身也可能危险。
怎么研究
可注入缺失输入、版本不匹配、规则冲突和记录故障,比较继续、停止、降级与请求确认的后果、误触发、恢复和人员理解。应采用风险加权指标,不能只以任务完成率评价。还需验证“解释失败”检测器,避免以空洞文本绕过门槛。
边界
可解释并不等于正确,不可用简短规则也不等于模型必然危险;门槛与动作后果相关。移动平台在车流中急停可能比保持车道减速更危险,医疗辅助也可能需要保持生命支持。保守默认必须在风险分析中具体定义。
怎么落地
- 为高后果动作列出执行前必须存在的证据字段与一致性检查,缺失即阻止正常提交。
- 按当前动力学与环境选择停止、减速、保持或转人工,外显触发原因和恢复条件。
- 故障注入验证系统不能用模板解释绕过检查,并测量误触发、风险暴露时间和安全恢复。