Z2.02.3Escalation of high-stakes actions设计研究
高后果动作不应由单次推断触发
别名: 置信门槛 · 分级自动化 · mixed-initiative
概念解释
推断有错误率,风险 = 错误率 × 动作后果。低后果动作(开灯、放音乐)错了可以忽略,单次推断直接执行没有问题;高后果动作——开锁、付款、对外发送、不可逆操作——一次错误就不可接受,不能由单次概率判断直接触发。它们需要升级(escalation):多源印证、时间内重复触发、或用户即时确认,三者至少居一。
判据不是动作本身「重不重要」,而是错误发生后的可撤销性与外溢范围:灯开错可以关掉,门开错不能收回,消息发错已经出了门。
机制
数量级决定了这不是保守与否的问题:活动识别在最好条件下也有一到两成错误率,单次推断的错误率是百分比级,不是小数点后几位。低后果场景下这个错误率被日常忽略(人没发现灯多开了一次),高后果场景下它是灾难的固定概率——每天一次的高后果自动化,两成错误率意味着一周内必然出错。
升级手段各自的机制与代价:
- 多源印证:两个独立模态同时指向才执行。前提是失效条件不重叠(否则同一个干扰骗过两路),代价是漏报率上升(要两路都看见)。
- 重复触发:短时间内多次推断一致才执行。对不相关错误有效;对系统性偏差(传感器漂移、体貌相近的家人)无效——重复采样消不掉同源的错。
- 即时确认:把最终决定交还用户。安全性最高,代价是把自动化的便利全部或部分退回手动;高频动作的确认疲劳会让用户机械点「是」,确认形同虚设。
怎么研究
- 混合主动接口的原则:Horvitz 1999 年提出的 mixed-initiative 原则给出决策框架——自动化的价值与等待成本、错误代价共同决定是否、何时把决定权交还用户。高后果单次推断违反的就是这套权衡。
- 决策论表述:expected cost of a false action = P(误判) × 代价。信号检测论的代价加权思想直接适用:动作的触发门槛应设在「误动作期望成本 = 漏动作期望成本」的平衡点,高后果动作该点天然偏向高门槛。
- 确认疲劳研究:安全领域对确认对话框的经典发现——确认频率升高时用户的自动化依从率上升、阅读率下降(泛化为「警报疲劳」现象,医疗警报管理文献充分)。用于评估「每次都确认」方案的真实有效性。
方法论注意点:评估升级方案要同时测两个方向的错误(误触发率与漏触发率)加上用户负担(确认次数、响应时间)——只优化其中一个的方案在另外两个上必然退化。
边界
- 高频动作可能反向权衡。 每次出门都要确认的「离家模式」,确认成本累计超过偶发错误的代价——此时正确解不是加确认,而是降低动作后果(可逆化)或提高推断质量。
- 紧急场景反过来设计。 跌倒检测这类漏报代价极高的功能,宁误报不可漏报——升级逻辑反转:降低门槛、主动询问、超时默认求助。
- 重复触发对系统性错误无效。 它只能压不相关噪声;识别混淆(把家人认成另一人)是系统性的,重复一百次也一样错。
怎么落地
- 把自动化动作清单按两个轴分级:可逆/不可逆、对内/对外。落在「不可逆」或「对外」象限的动作强制走升级路径。
- 为每个高后果动作明确升级方式与参数:需要几路印证、多长窗口内几次一致、确认超时后的默认(超时不该默认执行)。
- 定义每档动作的错误预算(每千次允许几次误动作),上线后按预算回测。
- 验证办法:注入误判场景——把推断引擎的输出人工替换为错误标签,观察系统是否仍触发高后果动作。任何单点注入就能触发的路径都是缺陷。