L1.08.1confidence is unverifiable self-report设计研究

置信度是模型的自我报告,用户没有独立核验它的手段

别名: 自我报告把握 · 无法核验的置信 · unverifiable confidence

概念解释

温度计上的数字可以拿第二支温度计对。生成框旁的「把握 80%」没有第二支。它是模型对这次输出的自评,用户既不能打开计算过程,也不能用一次使用去证伪这个 80%。不可核验的自我报告(unverifiable self-report)把置信度放回它的认识论位置:证言,不是测量。

这条不讨论证言偏不偏高,只讨论人手里没有核对它的仪器。

机制

核验需要独立通道。温度有第二传感器,正确率有事后标签,引用有原文链接。内部分数的独立通道要么不存在(logits 不对外),要么用户用不起(自己标一千题画可靠性图)。于是界面上的数享受了测量的形貌,却没有测量的可反驳性。不可反驳的数会被当成权威,不是因为人轻信,是因为反对它的手续不存在。

人仍会尝试核验:再问一次「你有把握吗」,或看语气。第二次自我报告与第一次相关,不构成独立证据。语气是同一套生成过程的另一面。所谓核验在绕圈。

怎么研究

给带分数的输出,问「你怎么知道这个 80% 是真的」,记录人们提出的核验策略,再看这些策略是否在界面上可执行。自变量:是否提供独立通道(回源、二次模型、历史命中率)。因变量:策略类型、是否执行、对分数的信任是否随「无法核对」的意识下降。

「我说我信它」不能当核验。要看人是否能指出一个与模型自评无关的观察。

边界

有外部标签且界面展示的是历史命中率,不是当次自评时,核验通道存在——那已经不是置信度,是统计。专家用户若能用领域知识直接查内容,他们核验的是命题,不是那个数;数仍然不可核。儿童和依赖界面的用户更没有第二通道。这条不处理百分数被读成频率,那是格式的言语行为。

怎么落地

  • 把自评标成「模型自己说的把握」,不要标成测量。旁边给一条独立通道:来源链接、第二次不同方法的计算、或「我们无法核对这次的把握」。
  • 不要提供「再问一次它有多有把握」作为核验。那是同一证言的回声。
  • 若没有任何独立通道,考虑不显示当次分数,改显示可核验的东西(来源、校验结果)。
  • 验证:指着分数问「你怎么拆穿它」。若答不出一个界面上能做的动作,这个数就是不可核的证言。再看有没有人用「它说它有把握」当作已经核对过内容。

延伸

  • 同组L1.08.2 百分数会被读成频率承诺,而模型给出的数值多数未经校准 · L1.08.3 分档呈现比连续数值更不易被过度解读,代价是掩盖档内差异 · L1.08.4 对同一批输出统一显示高置信等于没有提供区分度 · L1.08.5 置信度只有在用户能据此改变下一步动作时才值得显示
  • 相邻L1.04 置信度呈现 · L3.02 来源标注 · L5.01 可解释性的类型
  • 站内检索unverifiable self-report · confidence as testimony · no second instrument

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L1.08.1