L5.01.2post-hoc explanation vs true mechanism设计研究

事后解释不等于真实机制

别名: 事后解释 · 忠实度 · post-hoc fidelity

概念解释

贷款被拒之后,界面生成一句「因为收入不稳定」。这句话是在结果出来以后,另找一套语言来安放它。模型真正用来打分的,可能是邮编、渠道来源,或训练里从未写进文案的相关。事后解释不是真实机制(post-hoc explanation vs true mechanism):前者是对已有输出的叙述,后者是产生该输出的计算。

叙述可以有用,也可以完全跑偏。有用与否不自动等于忠实。这条管的是这层不等价,不管解释该对着一次输出还是对着整套行为。

机制

不可解释的模型被要求「说人话」时,常见做法是再训一个会说话的附件:线性代理、注意力可视化、生成式理由。附件优化的是像不像人能读的原因,不必优化是否走了同一条计算。用户读到的因果链,于是可以和内部决策正交。

人默认叙述来自做事的那一套装置——问厨师「为什么咸」,期望听到的是他放盐的动作,而不是旁白事后编的口味故事。界面把旁白印在结果旁边,默认就被读成机制。Miller 指出解释是社会选择的产物:选哪些因素来说,已经在编辑。事后附件把编辑权交给了第二个模型,忠实度没有担保。

怎么研究

同一批输入跑原模型,再跑解释附件,检查两件事:附件列出的因素若被扰动,原输出是否真变;附件没提的因素被扰动,原输出是否其实更敏感。自变量:附件类型(生成理由 / 代理模型 / 注意力图)、是否向用户声明「这是事后说明」。因变量:忠实度(输出是否随被强调因素变化)、用户对机制的信念、按解释去改输入后的实际成功率。

不要用「觉得被解释清楚了」代替忠实度。主观清楚和机制对齐是两个量。

边界

本身可检查的规则系统(明确的决策表、可逐步展开的公式)里,打印出来的路径可以就是机制,这条的不等价会收窄。生成理由在创作任务上往往只被当成文案,用户并不拿它当因果,危害较小。危害集中在有对错、且用户会按理由去改材料的场景。这条不处理过程层与结果层的分工。

怎么落地

  • 事后说明必须标明身份:「这是对结果的说明,不是计算步骤的回放。」
  • 能提供可扰动证据时再给因素列表:改这个字段,输出确实变。给不出证据就不要写成「因为」。
  • 禁止用流畅的因果句去包装与内部分数无关的因素。宁可短、可核对,不要像故事。
  • 验证:按界面强调的因素改一版输入,看输出动不动。若用户照做而结果不变,解释在说谎;把那条从产品里拿掉。

延伸

  • 同组L5.01.1 解释过程与解释结果是两回事 · L5.01.3 解释的对象是决策而非模型
  • 相邻L5.02 局部解释与全局解释 · L5.08 反事实解释 · L5.03 信任校准
  • 站内检索post-hoc explanation · explanation fidelity · rationalisation

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L5.01.2