L1.04.2uncalibrated confidence设计研究

未校准的置信度会误导判断

别名: 校准缺失 · 过度自信分数 · miscalibration

概念解释

一个分数若自称 80%,那么被标成 80% 的那些题,长期看就该对大约八成。对不上,这个分数就是未校准的(uncalibrated)。现代神经模型常把质量堆在高分区,80% 桶的真实命中可能只有 55%。人仍按 80% 下注。误导不是因为他们不懂百分比,是因为这个百分比没有履约。

已知置信不是正确率之后,校准问的是:这个数能不能至少当粗糙的概率用。

机制

训练目标(交叉熵、偏好对齐)不直接惩罚「高分低中」。温度、指令微调、RLHF 还会把分布挤尖,分数普遍偏高。Guo 等人在分类器上画的可靠性图,生成模型的自洽分数上同样常见:中间段塌、两端顶。界面把这样的数原样递给决策者,等于把模型的过度自信复制成人的过度自信。

人很少有机会做自己的校准实验。题目不可复现、反馈延迟、一次只用一次,基率无法在使用中被学会。于是未校准的数会一直被当作已校准的数用下去。

怎么研究

可靠性图、ECE、Brier 分数是标准度量。对人的研究要再加一层:给已校准 vs. 未校准的同一组题,看下注、复核、交托如何变。自变量:是否做温度缩放或直方图分箱、界面是否提示「这些分数偏高」。因变量:人侧校准(他们的置信 vs. 他们的正确)、过度交托。

只在实验室用校准过的分数做题,会得出「显示置信有益」;现场若仍是生分数,结论不能搬。

边界

经过温度缩放、并在同一数据分布上维护的分数,可以当粗概率用——分布一移(新领域、新提示风格)校准立即过期。没有对错标签的开放生成,校准无法定义,显示数字本身就在假装可校准。用户若完全忽略分数,未校准暂时不伤判断,但那只说明分数是废物,不是它已经校准。这条不展开「高分错误特别伤」,那需要另一次对危害路径的分析。

怎么落地

  • 上线任何把握数字之前,在你们自己的任务分布上画可靠性图。对不上就不要显示数字,改分档或干脆不显示。
  • 若显示,先做校准(温度缩放、分箱),并在数据漂移后重做。校准是维护项,不是一次发布。
  • 明确告诉人「高档仍会错」。不要用视觉把高档画成绿灯。
  • 验证:抽最近真实流量里带分数的样本做人工对错,按显示档分桶。某档自称「高」而命中接近随机,这档必须从界面拿掉。

延伸

  • 同组L1.04.1 置信度与正确率不是同一件事 · L1.04.3 高置信的错误比低置信的错误危害更大
  • 相邻L1.03 不确定性的可视化 · L1.08 置信度呈现及其误导 · L5.03 信任校准
  • 站内检索uncalibrated confidence · expected calibration error · reliability diagram

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L1.04.2