L1.08.4uniform high confidence is no signal设计研究
对同一批输出统一显示高置信等于没有提供区分度
别名: 无区分度置信 · 全员高分 · collapsed confidence
概念解释
十条建议旁边各挂一个 96%。用户无法用这个数决定先核哪条、信哪条、丢哪条。分数占用了注意力,却给不出排序。统一高置信等于没有信号(uniform high confidence is no signal):显示的前提是同一屏上的项目之间有可动作的差别。没有差别,置信是装饰,而且是会抬高整批信任的装饰。
区分度是相对的。绝对的「都很高」在决策里等于没说。
机制
RLHF 和指令微调把分布挤向高分,界面再按原始分显示,一批结果就会顶在天花板上。人用分数做的工作是分配稀缺的核对时间。天花板上没有梯度,分配退化成阅读顺序或位置偏好,分数白占了一列。
更坏的是水平本身仍在说话。十条 96% 不会被读成「这列没信息」,会被读成「这批都很稳」。无区分度的高分是一条对整批的背书,比不显示更容易关掉核对。信息论上熵为零的通道还在发射一个常数;常数在这里不是静音,是持续的「高」。
怎么研究
两批材料:分数有梯度(跨动作阈值)vs. 全部顶在高档。测:核对时间的分配是否跟分数走、整批信任、漏过植入错误的位置。自变量:是否显示分数、高分是校准后的真高还是挤顶。因变量:区分使用、整批交托。
若有梯度时人按分数分配核对、无梯度时整批都少核对,无区分度的害处就不是「没用」,而是「当背书用」。
边界
真的校准之后整批都高,且任务允许整批少核对(低后果、可逆),常数高分是诚实的。高后果下即使真高,也该改成「本批未分出优先核对象」而不是十条绿灯。只有一条输出时,区分度无定义,这条不适用,回到单次自评是否可核、是否可行动。这条不讨论分档切法。
怎么落地
- 显示前先看本屏分数的散布。几乎无散布就不要显示当次分数,改一句「这批没有分出哪条更有把握」。
- 需要分配核对时,用排序或「建议先看这几条」,不要用一排同样满的条。
- 对挤顶做校准或截断:高档配额封顶,逼出相对差别;逼不出就关机。
- 验证:截一张十条全是满条的屏,问「你先核哪条」。答案若是「随便」或「从上往下」,列是空的。再问「这批整体靠不靠谱」——答「很靠谱」,空列还在抬信任。