过度精确的数值会制造虚假确定感
别名: 虚假精度 · 过度精确 · spurious precision
概念解释
「置信度 87.42%」看起来像测量。生成模型给出的那个数,常常只是一次未校准的 softmax 最大值,连十分位都没有测量意义。把没有意义的位数写出来,人会按有意义的位数去读。虚假精度(false precision)是用数字的形貌去冒充分辨力。
它不是「该不该显示不确定」,也不是「档该有多细」。它是:你写下的每一位,都被当成承诺。
机制
数字认知把有效位数读成证据质量。两位小数是实验室仪器的语言,不是「我们内部有个 0–1 的浮点」。Spiegelhalter 谈风险沟通时反复指出:格式在说话,内容还没开口。87 和 87.42 在校准很差的模型上往往不可区分,界面却用后者暗示可以比较 87.42 和 86.91。
更糟的是比较会真的发生。人会在两个都不可靠的数之间选较大的那个,以为自己做了定量决策。虚假精度把噪声变成了可排序的伪信号,决策被噪声的排序驱动,还自我感觉比「大概」更科学。
怎么研究
同一潜在分数,做成整数百分比、一位小数、两位小数、以及分档词。测:两数之差小于模型校准误差时,人是否仍按大小做选择;以及事后对「这个数有多准」的估计。自变量:位数、是否同时出示校准误差或「约」字。因变量:过度分辨、校准判断、选择稳定性(对分数加微小抖动后选择是否翻转)。
微小抖动后选择大规模翻转,说明人们在用你们提供的伪精度做决定。
边界
经过认真校准、且误差远小于显示分辨力的概率(某些天气预报点)可以承担更多位数。那是测量,不是 softmax。金融、剂量领域有法定小数规则,那些位数是制度要求,不是模型自信。即使用分档词,过细的七档(几乎肯定/非常可能/…)也会重新引入虚假分辨。这条管的是形貌上的精度,不管置信和正确率是不是一回事。
怎么落地
- 默认用分档词或整十的粗百分比,位数不得超过你们实际校准能支撑的分辨。测不准到 10 个百分点,就不要写 87。
- 需要数字时,用「约 80%」或区间「70–90」,把宽的那一维写出来。
- 禁止给未校准的 logits 做两位小数的进度条。条的长度会被读成精确测量。
- 验证:把显示值加减一个小于校准误差的抖动,看人的选择变不变。变了,就是假精度在驱动决策。再问「87.42 和 86 差多少把握」——若他们讲出一套精细故事,格式已经在撒谎。