Z3.01.2Confidence-matched automation levels设计研究

等级需与推断置信匹配

别名: 置信匹配 · 置信分级 · uncertainty-aware interaction

概念解释

系统对用户意图的判断带着置信度——一个概率,不是事实。主动性等级必须跟着置信走:置信高才允许自动执行,置信低就退回建议或沉默。这个映射原则(confidence-matched automation)是等级谱系的使用说明:同一功能在「我很确定你要开灯」(人在家、天黑、走向灯)和「我猜你可能要开灯」(历史上有过此时开灯)两种判断下,应该运行在不同等级上。

反模式是把等级当静态属性:功能定义时定死「自动执行」,之后无论某次推断把握多大都照样执行。等级错了固定的代价由每次推断的质量承担——低置信的那部分触发,恰恰贡献了绝大多数错误。

机制

为什么必须动态匹配?把成本拆开看:自动执行一次的期望错误成本 = (1 − 置信)× 动作后果量级。置信是乘数:后果轻微时低置信也无所谓(错关一次灯不值一提),后果越重,置信门槛必须越高。等级与置信的匹配本质是让「介入时机」跟住这个乘积的变化。

第二层是信息价值的不对称。低置信时,把决定权交还用户(降级为建议)几乎不损失信息——用户看一眼就能纠正;高置信时才执行,用户连看都不用看。降级机制把「系统的不确定」转化为「一次廉价的用户确认」,这是整个隐式交互里最划算的交换。

反过来,静态等级等于把置信信息丢弃不用:系统明明知道自己只有六成把握,仍然全量执行,错误成本按最差情况累积。用户感受到的是「它有时灵有时不灵」,而系统本可以说「这次我不太确定」。

怎么研究

  • 决策论框架:Horvitz 一系的工作把「何时打扰用户、何时自作主张」形式化为期望效用比较——行动价值、推断置信、打断成本三者进同一个目标函数,等级选择是它的解。这一框架给出了置信阈值的推导方式,而不是拍脑袋数值。
  • 校准研究:机器学习与人机交互交界处的置信校准(calibration)工作检验「模型自报的置信是否与真实正确率一致」——匹配原则的前提是置信本身可信,系统性过信的模型会把本该降级的触发照常执行。评测方法是可靠性图(reliability diagram)与期望校准误差。
  • 交互实验:同一自动功能在「固定等级」与「置信自适应等级」两版间做对照,因变量取误执行率、用户校正次数、信任量表与被感知的可预测性。

方法论注意点:置信匹配的效果不能只看总错误率。自适应降级会改变错误的分布——把「自动执行的大错」换成「多问一句的小烦」,总量下降但打扰感上升,两类代价必须分开记,否则实验会得出「匹配更差」的假象。

边界

  • 前提是置信可用且校准。 模型给不出有意义的置信(或严重过信)时,按置信匹配等于按噪声匹配;此时只能回到保守的固定低等级。
  • 置信不是唯一维度。 同等置信下,后果量级与可逆性仍独立地决定安全等级——高置信 × 不可逆后果依然不该全自动。置信解决的是「谱上滑多远」,不豁免后果维度。
  • 用户感知不到置信的降级闪烁。 功能在建议与自动间频繁切换,用户无法建立稳定预期,可预测性受损;匹配需要平滑与迟滞,不能逐触发点抖动。

怎么落地

  • 给每个主动功能定义置信阈值曲线而不是单一等级:低后果动作阈值可低(八成把握就做),高后果动作阈值抬高(接近确定才做)。
  • 降级路径要具体:置信不足时退到哪一格(沉默/提示/建议+一键)必须事先定义,并给用户可感知的理由(「不太确定,要开灯吗」)而不是静默不响应。
  • 引入迟滞:从自动降级到建议后,需连续多次正确判断才回升,避免等级来回抖动。
  • 验证办法:按置信分桶统计事后正确率,检查桶间是否单调(置信高的桶错误率确实低);再统计「低置信触发被降级」的比例——若低置信触发大量被执行,匹配没生效。

延伸

  • 同组Z3.01.1 从提示、建议到自动执行是连续谱 · Z3.01.3 等级应可由用户设定
  • 相邻Z3.02 自动执行的边界 · Z2.02 推断的不确定性
  • 站内检索confidence-matched automation · calibration · decision-theoretic interruption · uncertainty-aware interaction

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/Z3.01.2