L1.04.1confidence is not accuracy设计研究

置信度与正确率不是同一件事

别名: 置信不等于正确 · 自我报告把握 · confidence versus accuracy

概念解释

模型说「我有八成把握」,听起来像「这类题它八成会做对」。前者是一次输出的自我评分,后者是在重复试验里的命中频率。置信度不是正确率(confidence is not accuracy):一个数描述的是模型此刻有多像在确定,另一个数描述的是它历史上有多常对。界面若把第一个数当第二个数来用,用户就是在拿独白当统计。

这条先把两个量拆开。校不校准、高置信错误有多伤,是后面的事。

机制

分类器和生成模型都能吐出一个 0–1 的分数:最大 softmax、序列对数概率、自洽抽样的一致率。这些分数优化的是内部目标,不必与外部正确挂钩。人读百分比的默认语义却是频率——「八成」就是十次里八次。两种语义撞在同一块 UI 上,频率解读会赢,因为那是百分比在日常语言里的工作。

生成式输出还没有单一的「正确」可对。一句流畅的假引文可以带很高的序列概率。分数在奖励流畅,用户在购买正确,买卖的不是同一商品。

怎么研究

收集一批带模型分数的题目,独立标对错,画可靠性图:每个分数桶里的实际命中率。同时问用户「这个 80% 是什么意思」,看有多少人说成「十次里大约八次对」。自变量:分数的名称(置信/把握/可能性)、是否出示「这不是正确率」的注解。因变量:语义选择、随后的交托。

用户语义和真实校准要分开报。注解改了语义但校准仍差,问题会转移到下一张。

边界

在有外部标签、分数又被专门训成概率的系统里,两者可以被拉近,但仍然是两个量,只是碰巧数值接近。天气预报的「降水概率」是对频率的承诺,生成框里的「把握」通常不是。没有对错可言的创作任务上,正确率这个量不存在,置信度若还在显示,语义只能是「内部一致」,必须改名。这条不处理未校准的危害形态,只处理概念替换。

怎么落地

  • 不要把内部分数标成「正确率」或「准确度」。用「模型自评的把握」,并加一句它不是历史命中率。
  • 若你有真实命中率,显示那个,不要显示内部分数。命中率要写清题目范围:「在发票字段抽取上,最近一千次中对了 82%」。
  • 创作类输出默认不显示 0–100 的把握条,以免被读成正确率。
  • 验证:指着一个 80% 问「假如同样的题做十次」。答案若是「大约八次对」,而你们没有这个频率证据,标签在把置信冒充成正确率。

延伸

  • 同组L1.04.2 未校准的置信度会误导判断 · L1.04.3 高置信的错误比低置信的错误危害更大
  • 相邻L1.03 不确定性的可视化 · L1.08 置信度呈现及其误导 · L5.03 信任校准
  • 站内检索confidence versus accuracy · reliability diagram · self-reported confidence

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L1.04.1