Z2.07.3Evidence-specific explanations设计研究
可解释性需要指出判断依据的具体信号
别名: 具体信号解释 · why 解释 · input-based explanation
概念解释
解释情境判断时,指明依据的具体信号才有效:「客厅人体传感器 21:00 后无移动,且手机在家中,所以判定你睡着了」是解释;「根据你的使用习惯」不是——后者是把判断重新包装了一遍,没有增加任何可供检验的内容。
有效解释的检验标准是可证伪:用户能拿它对照现实(「可我手机明明在充电没动,人一直在书房」),从而发现判断错在哪。泛泛的解释无法被反驳,也就无法把讨论推向修正——它只制造「系统很智能」的印象,把解释降级成了话术。
机制
为什么具体信号是解释的有效成分?因为用户检验判断的心智过程是对照证据,不是领会理由。判断错了有两种可能:证据本身错(传感器读数不对),或推理错(证据对但结论跳了)。指明信号让用户能区分两者:
- 看到「人体传感器无移动」而自己一直在客厅——定位到证据错,纠正动作是换传感器位置或补充信号源;
- 看到「手机在家 + 晚间 + 无移动 → 睡着」而自己只是在安静看书——定位到推理跳步(晚间无移动不等于睡着),纠正动作是改判断规则或加确认环节。
泛泛解释同时藏起两种错误的边界,用户既定位不了证据错也定位不了推理错,只剩「它不对」一个笼统结论——下一步往往不是纠正而是关掉。
具体性还有第二重作用:信号是行动的锚点。纠正入口需要知道「改什么」——哪个传感器、哪条规则、哪个阈值。解释里不出现信号,纠正就成了无处下手的空按钮。
怎么研究
- Lim、Dey 与 Avrahami 的 CHI 2009 工作直接比较了解释类型:针对「为什么触发/为什么没触发」的场景,基于具体输入的why / why-not 解释比抽象概括的解释更能提高用户对系统行为理解的准确度。why-not 解释尤其依赖具体信号——「未满足的条件是哪一个」必须逐项亮出来。
- Bellotti 与 Edwards 的可问责框架把要求说得更硬:系统不仅要显示判断(intelligibility),还要显示判断所依据的感知并接受质询(accountability)——只报结论不报依据的系统是不可问责的。
- 实验范式:同一判断配三种解释(无解释 / 泛泛解释 / 信号级解释),量用户预测系统未来行为的准确率、纠正行为的准确率(能否改对地方)、信任量表。纠正准确率是信号级解释最有区分度的因变量——泛泛解释组用户的纠正经常改错对象。
方法论注意点:解释的「具体」程度要在真实故障压力下测。无故障时所有解释版本都显得可信,差别只在故障显形后——研究设计里必须包含判断出错的试次,否则测到的只是文案偏好。
边界
- 具体性有暴露代价。 信号级解释顺带交代了家里有什么传感器、装在哪——对主人是透明,对访客与恶意者就是侦察。粒度按受众裁剪:这里要求的下限是「具体到可证伪」,至于具体到哪一层、给谁看,是解释粒度权衡要处理的问题。
- 信号≠全部依据。 学习型模型的判断(活动识别模型)没有可逐条列出的规则,只能给出贡献最大的信号(特征归因)。这类「最相关信号」的解释是近似的——诚实标注近似性好过装出完全解释。
- 具体解释救不了信号覆盖不足:解释得再清楚,依据只有一路传感器时,判断质量的天花板仍然由那一路信号决定。解释让问题可见,不替代多源验证。
怎么落地
- 解释模板固定为三段:结论 → 信号清单 → 推断规则(「判定已入睡 ← 人体传感器 21:00 后无移动 + 手机静止在家;规则:晚间两者同时成立即判入睡」)。三段缺一不可,缺规则段的解释无法支撑「改规则」的纠正。
- why-not 场景逐项亮出未满足的条件,不许只说「条件未满足」。
- 特征归因类解释标注近似性:「主要依据:晚间、无移动、设备静止」——明示这是贡献度排序不是规则全文。
- 验证办法:给用户一批已知有错的判断,统计他们拿解释后的纠正命中率(改对了传感器/规则/阈值)。命中率是解释具体性最硬的验收指标;仅测「解释满意度」会把话术型解释也放过去。