L1.08.3bands versus continuous confidence设计研究

分档呈现比连续数值更不易被过度解读,代价是掩盖档内差异

别名: 分档置信 · 档内差异 · coarse confidence bands

概念解释

「低 / 中 / 高」强迫决策停在三档阈值上,人很难在 61 和 67 之间编造故事。连续条和两位小数正好邀请这种故事。分档(confidence bands)用分辨率换掉过度解读;代价是档内的真差异被抹平——61 和 89 若都叫「中」,需要不同动作的两个点看起来一样。

这是刻度选择,不是该不该显示。

机制

连续刻度提供可排序性。可排序性在分数不可靠时是漏洞:人会把噪声的序当成信息的序。分档把序锁死在少数边界上,边界以外禁止比较。气象和医学沟通里用有限等级,就是在收缴这种假比较。

收缴之后,动作只能按档翻转。若真实决策需要的翻转点落在档内,分档会迟钝。三条档若按等宽切,而校准误差在高段最大,高档仍会装进许多不该进的点——分档不能代替校准,它只是限制解读。

怎么研究

同一批题,连续 % vs. 三档 vs. 五档。看:相邻分数之间的假比较(差值小于校准误差仍改选择)、档内应当不同动作却没不同的漏。自变量:档的切法(等宽 / 按校准误差 / 按动作阈值)、档名(数字范围 vs. 词)。因变量:过度分辨、漏分辨、决策时间。

切法必须跟动作走。按美观等分的档,测到的「分档无效」往往是切错了,不是分档这个想法错了。

边界

专家监控墙需要看漂移,连续刻度是工具不是装饰,但那是专业仪表,不是给一次生成的旁注。两档(过 / 不过)在高后果闸门上往往对;在探索任务上会钝。档名用「87–100」会把百分号从后门放回来。这条不处理整批都标高档的区分度崩溃,那是下一张。

怎么落地

  • 默认三档,切在会改变动作的地方:例如「必须人工看 / 抽查 / 可直接用」,不要切在 33 和 66。
  • 档内禁止再给细条或第二位小数。分档的收益就是不许再比。
  • 说明档内会被抹平:「中」不是一样有把握,只是动作相同。
  • 验证:拿出两个同档、校准上不该同动作的样本,看界面是否逼人做出不同动作。会,档切错了。再拿出差 3 个百分点的两个连续值,看人是否编出不同故事——会,就该回到分档。

延伸

  • 同组L1.08.1 置信度是模型的自我报告,用户没有独立核验它的手段 · L1.08.2 百分数会被读成频率承诺,而模型给出的数值多数未经校准 · L1.08.4 对同一批输出统一显示高置信等于没有提供区分度 · L1.08.5 置信度只有在用户能据此改变下一步动作时才值得显示
  • 相邻L1.03 不确定性的可视化 · L1.04 置信度呈现 · L5.05 透明度的适度原则
  • 站内检索confidence bands · over-reading continuous scores · within-band collapse

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L1.08.3