L1.08.1confidence is unverifiable self-report设计研究
置信度是模型的自我报告,用户没有独立核验它的手段
别名: 自我报告把握 · 无法核验的置信 · unverifiable confidence
概念解释
温度计上的数字可以拿第二支温度计对。生成框旁的「把握 80%」没有第二支。它是模型对这次输出的自评,用户既不能打开计算过程,也不能用一次使用去证伪这个 80%。不可核验的自我报告(unverifiable self-report)把置信度放回它的认识论位置:证言,不是测量。
这条不讨论证言偏不偏高,只讨论人手里没有核对它的仪器。
机制
核验需要独立通道。温度有第二传感器,正确率有事后标签,引用有原文链接。内部分数的独立通道要么不存在(logits 不对外),要么用户用不起(自己标一千题画可靠性图)。于是界面上的数享受了测量的形貌,却没有测量的可反驳性。不可反驳的数会被当成权威,不是因为人轻信,是因为反对它的手续不存在。
人仍会尝试核验:再问一次「你有把握吗」,或看语气。第二次自我报告与第一次相关,不构成独立证据。语气是同一套生成过程的另一面。所谓核验在绕圈。
怎么研究
给带分数的输出,问「你怎么知道这个 80% 是真的」,记录人们提出的核验策略,再看这些策略是否在界面上可执行。自变量:是否提供独立通道(回源、二次模型、历史命中率)。因变量:策略类型、是否执行、对分数的信任是否随「无法核对」的意识下降。
「我说我信它」不能当核验。要看人是否能指出一个与模型自评无关的观察。
边界
有外部标签且界面展示的是历史命中率,不是当次自评时,核验通道存在——那已经不是置信度,是统计。专家用户若能用领域知识直接查内容,他们核验的是命题,不是那个数;数仍然不可核。儿童和依赖界面的用户更没有第二通道。这条不处理百分数被读成频率,那是格式的言语行为。
怎么落地
- 把自评标成「模型自己说的把握」,不要标成测量。旁边给一条独立通道:来源链接、第二次不同方法的计算、或「我们无法核对这次的把握」。
- 不要提供「再问一次它有多有把握」作为核验。那是同一证言的回声。
- 若没有任何独立通道,考虑不显示当次分数,改显示可核验的东西(来源、校验结果)。
- 验证:指着分数问「你怎么拆穿它」。若答不出一个界面上能做的动作,这个数就是不可核的证言。再看有没有人用「它说它有把握」当作已经核对过内容。