L1.08.2percents read as frequency promises设计研究

百分数会被读成频率承诺,而模型给出的数值多数未经校准

别名: 百分比承诺 · 频率解读 · percent as hit-rate

概念解释

「72%」在天气预报里是履约句:一百个像这样的日子里,大约七十二个会下雨。生成旁边同样写下 72%,人会按同一份合同来收账。模型内部的那个浮点多数从未对过这笔账。百分数被读成频率承诺(percents read as frequency promises)是格式自带的言语行为,不等人去误解。

置信和正确率不是一回事,已经拆过。这里拆的是「%」这个符号在说话。

机制

百分号是频率的字形。天气预报、考试通过率、电池电量把这个字形训成了「在重复中的比例」。一次自评被排成 72%,字形比脚注更硬,脚注里的「未经校准」赢不了。Gigerenzer 谈风险沟通时强调自然频率之所以有效,正是因为百分号已经在许诺频率。生成产品借用了这个许诺,却没有频率可以兑付。

未校准使许诺变成空头。人按 72% 去分配核对时间:将近四分之三该对,我抽查四分之一。真实命中若是 50%,抽查配额就系统性地不够。格式在替产品签一份它签不起的合同。

怎么研究

同一潜在分数,做成 %、做成「十次里大约七次」、做成「偏有把握」、做成「未校准的内部值」。问「假如有一百次这样的题」。自变量:符号、是否同时写「这不是预报」。因变量:是否给出频率答案、随后的抽查配额、在真实命中揭晓后的受骗感。

自然频率组若仍按频率收账,问题在语义不在符号;只有 % 组如此,问题就在字形。

边界

经过公开校准、并按预报规范发布的概率可以承担百分号——那是真的在签频率合同。电池和进度条的 % 承诺的是容量或完成,不是命中,借到置信上会再乱一层。分档词避开了百分号,但「很可能」仍会被一部分人翻译回「大概八成」;那是下一张的代价。这条只管 % 作为承诺格式。

怎么落地

  • 当次自评不要用 %。用词,或用「这不是十次里七次对」。
  • 若你真有频率证据,写清分母和窗口:「最近一千张发票字段,对了 720 张」,那才是可兑付的百分数。
  • 脚注「仅供参考」盖不住 %。实验里脚注几乎输给字形。
  • 验证:只给「72%」不问其他,听写「这是什么意思」。出现「一百次里七十二次」,而你们没有这个频率,格式在空头许诺。再看他们给这类结果留了多少核对时间——按 72% 留的,对 50% 的真实命中不够。

延伸

  • 同组L1.08.1 置信度是模型的自我报告,用户没有独立核验它的手段 · L1.08.3 分档呈现比连续数值更不易被过度解读,代价是掩盖档内差异 · L1.08.4 对同一批输出统一显示高置信等于没有提供区分度 · L1.08.5 置信度只有在用户能据此改变下一步动作时才值得显示
  • 相邻L1.04 置信度呈现 · L1.03 不确定性的可视化 · L5.03 信任校准
  • 站内检索percent as frequency promise · natural frequency · uncalibrated percent

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L1.08.2