机器学习解释的定量评估:基于人类注意力的基准
可解释人工智能(XAI)可视化感知与认知软件工程师与开发者AI/ML 研究员与工程师HCI 研究员
文献标题
Quantitative Evaluation of Machine Learning Explanations: A Human-Grounded Benchmark
文献信息
- 主题领域: 人机交互、解释型人工智能 (XAI)、机器学习模型的可解释性
- 关键词: 机器学习解释、解释评价、解释基准、数据标注、人类注意力
研究背景与问题
-
发现的问题/挑战:
- 当前可解释性机器学习模型评价方法在评估结果的客观性和主观性上存在权衡:
- 客观评价测量解释与模型性能的保真程度,但无法体现人类认知对解释的认同感。
- 主观评价依赖用户反馈,但流程昂贵且容易带有主观偏差。
- 用户偏见和认知限制会使基于主观反馈的评价缺乏精确性。
- 缺乏一个一致、高效的框架来同时评估机器学习模型解释的正确性和完整性。
- 当前可解释性机器学习模型评价方法在评估结果的客观性和主观性上存在权衡:
-
研究的重要性:
- 可解释性对于增强用户对机器学习模型的信任至关重要,特别是在涉及安全、法律或伦理等高风险场景中。
- 提供可靠的评价基准能推动对XAI系统的精细设计。
-
研究动机与相关工作:
- 作者检讨了常用的解释生成方法(如 Grad-CAM、LIME),并指出它们在评估标准上的局限性。
- 相关研究在用户信任和解释的“意义性”之间建立联系,但鲜有综合人类注意力和客观评价的统一框架。
解决方案
-
提出的方法/解决方案:
- 作者提出了一种基于多层人类注意力标注的基准,能够作为机器学习模型“显著性解释”的量化评价标准。
- 该基准通过收集多个标注者的注意力信息生成多层人类注意力掩模 (human attention mask),适用于图像和文本领域。
-
创新之处:
- 提出多层人类注意力掩模,对显著性解释进行更细致的特征粒度划分,实现对“正确性”(false positives)和“完整性”(false negatives)的量化分析。
- 通过对比客观与主观评价法,揭示评估方法之间的系统性差异及用户偏见的影响。
- 在阈值无关的框架下使用平均绝对误差 (MAE) 作为显著性解释的标准评估指标,避免主观阈值选择的影响。
-
实施步骤/关键技术:
- 标注数据构建:
- 从图像数据集(PASCAL VOC和ImageNet)和文本数据集(20 Newsgroup 和 IMDB)中提取样本。
- 使用Amazon Mechanical Turk (AMT) 平台收集10名唯一标注者对每个样本的注意力标注。
- 数据处理:
- 对标注结果进行聚合,生成多层掩模,去除背景像素的冗余干扰。
- 定量评估实验:
- 将提出的基准与现有的单层目标分割掩模基准进行比较。
- 通过用户实验验证人类评分的主观评价结果与基准的相关性。
- 用户偏见量化:
- 考察主观评分受不同错误类型 (FP, FN) 和视觉呈现方式 (e.g., smooth-based Grad-CAM和chunky-style LIME) 的影响。
- 标注数据构建:
研究成果
-
具体成果:
- 构建了公开可用的人类注意力基准,涵盖图像和文本领域。
- 实验证明,与单层目标分割掩模相比,多层人类注意力掩模能捕获更为精细的特征显著性,更贴近人类的认知方式。
- 分析了人类主观评价与基准间的差异,揭示用户评分偏见的表现。
- 用户实验表明:
- 用户偏向于评分更平滑和直观的显著性图(如Grad-CAM相较于LIME的评分更高)。
- 对“非目标特征选取错误”(FP)宽容,但对“忽略目标特征错误”(FN)更敏感。
-
与现有解决方案相比的优势:
- 提供了可复制、阈值无关的量化评价指标。
- 通过多层掩模捕获更多的细粒度信息,与用户主观评分更加匹配。
- 可以减少因多轮人为主观评价带来的高成本和评估偏差。
-
实验或评估结果:
- 使用量化指标 (MAE) 比较了图像分类模型 Grad-CAM 生成显著性图的质量,实验支持多层人类注意力掩模的有效性。
- 观察到用户对某些显著性图的评分明显低于基准评价的结果,说明视觉特征呈现的外观和错误类型会影响用户评分。
-
局限性与未来方向:
- 局限性:
- 数据采集和人类注意力标注成本较高。
- 实验主要基于普通用户(非专家)参与的众包平台,可能不适用于特定领域专家任务。
- 未来方向:
- 探索不同数据类型和特征的通用人类注意力模式,以进一步标准化数据标注。
- 将该基准用于模型训练阶段,优化模型预测合理性,并验证其对提升解释质量的实际收益。
- 跨领域延展:应用于更多样化的数据类型与应用场景(如医学影像、法律文本等)。
- 局限性:
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何定量评估机器学习模型的显著性解释的正确性和完整性?分类: XAI 解释与适当依赖校准同类问题arrow_forward
- 现有的基于用户主观评分的解释评估方法存在哪些偏差?分类: XAI 解释与适当依赖校准同类问题arrow_forward
- 多层次的人类关注掩码是否能更好捕捉与人类认知一致的特征显著性?分类: XAI 解释与适当依赖校准同类问题arrow_forward
lightbulb
现实痛点
1- 用户难以信任机器学习模型提供的解释,尤其在关键场景中。分类: XAI 解释与适当依赖校准同类问题arrow_forward
- 80%
基于显著性模型解释的图形感知
CHI '23· 可解释人工智能(XAI) +1
- 67%
分歧去卷积:将机器学习性能指标与现实接轨
CHI '21· 可解释人工智能(XAI) +1
- 67%
《你真的确定吗?》理解人类自我信心校准在人工智能辅助决策中的影响
CHI '24· 可解释人工智能(XAI) +1
- 67%
Wikipedia ORES Explorer:机器学习API应用设计权衡的可视化
DIS '21· 可解释人工智能(XAI) +1
- 67%
不仅仅是营销?关于人工智能基准测试对从业者的信息价值
IUI '25· 可解释人工智能(XAI) +1
- 60%
会话式解释:与非AI专家讨论可解释AI
IUI '25· 可解释人工智能(XAI)
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3397481.3450689
一眼看懂
fact_check论文快照
dataset
来源
IUI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
可解释人工智能(XAI)、可视化感知与认知
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
6 篇相关论文