解开AI错误的困境:探索人类和机器解释对大型语言模型的有效性
大语言模型(LLM)的人机协作可解释人工智能(XAI)算法透明度与可审计性软件工程师与开发者AI/ML 研究员与工程师HCI 研究员
文献标题
解读人工智能错误的困境:探索大语言模型的人类与机器解释的有效性
文献信息
- 主题领域: 可解释人工智能 (XAI),特别是在大语言模型中的应用
- 关键词: 可解释人工智能 (XAI), 大语言模型 (LLMs), 显著图, 文本解释, 后验解释, 斯坦福问答数据集 (SQuAD 1.1v), 用户研究, 解释偏倚, 评估解释, 人类解释, 机器解释
研究背景与问题
-
问题或挑战:
- 随着深度学习和大语言模型的兴起,人工智能成为人类生活的重要组成部分,如何让人工智能更加可解释成为迫切需求。
- 现今的解释方法(如显著图)虽能提供超出模型预测的可视化,但其长期有效性和适用性尤其在模型输出错误时存疑。
- 对现有可视化方法(如显著图)的使用质疑,XAI方法缺乏全面的控制条件和人类参与式研究。
-
重要性: AI决策可能影响重大的社会领域如医疗诊断或贷款审批。透明性和可解释性不仅是技术需求,更是法律要求(如 GDPR 中的解释条例)。
-
研究动机与相关工作:
- 深度学习模型常被批评为“黑箱”,难以解释个体预测或生成的文本内容。
- 人类解释与机器解释之间的差异对性能、满意度和信任度的影响尚不明确。
- 需要更深入的人类与机器解释的比较,特别是在涉及错误预测的情况下。
解决方案
-
提出的解决方法:
- 收集156个人类生成的显著图和文本解释,并与最先进的机器解释(如保守层级相关性法 (Conservative LRP)、积分梯度 (IG) 和 ChatGPT生成的解释)进行比较。
- 设计三部分实验,其中包括解释收集、分析以及人类参与者对解释有效性的人类研究。
-
创新之处:
- 首次在文本生成任务中进行显著图的评估,同时考虑模型的正确和错误预测。
- 提供了直接比较人工解释与机器生成解释的方法,通过定量和定性的评估了解解释对用户信任、满意度及任务表现的影响。
- 引入“解释确认偏倚”的概念,并探讨与错误预测相关的解释的困境。
-
实施步骤与关键技术:
- 解释收集与生成:
- 使用问答任务样本来自SQuAD 1.1v 数据集,结合人工显著图和文本生成。
- 利用现有技术生成机器显著图(Conservative LRP 和 IG)并生成文本解释(ChatGPT)。
- 分析解释:
- 通过主题分析对人类文本解释进行分类,分组包括“提取”、“解释”、“误解” 和 “质量欠佳”。
- 对人类与机器生成显著图之间的重叠进行定量评估。
- 人类研究:
- 比较和评估人工与机器解释的主观满意度、信任、质量、帮助性等因素,同时跟踪任务的客观表现(正确率和任务时间)。
- 解释收集与生成:
研究成果
-
具体成果:
- 人工显著图和控制条件的解释(如仅显示答案位置)被认为比机器显著图更有帮助,同时任务时间更短。
- 在文本解释中,参与者对文本提取的信任度显著高于ChatGPT解释。
- AI预测的正确性对任务表现和主观感知的影响比解释种类更显著(影响如认知负荷、时间投入、满意度等)。
- 提出了解释的困境:"有效的解释在支持错误预测时可能降低任务表现"。
-
相较现有解决方案的优势:
- 对比了多种机器和人类生成的解释,侧重于真实任务场景和人类参与。
- 捕捉了参与者如何在面对解释特别是错误答案时表现出的信任机制和认知偏倚。
-
实验结果:
- 对主观评分(如满意度、信任度等)和客观指标(如任务时间、准确率)进行了分析。
- 在错误答案情况下,发现满意度、信任度与任务准确率呈负相关。
-
局限性与未来方向:
- 研究中的任务较短,未完全测试显著图在长文本中的探索能力。
- 人类参与者未接受什么是良好解释的专门培训,也无法对不同解释直接比较。
- 增加 AI可交互设计及提供关联案例对未来减少错误解释带来的影响可能有效。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 人工生成的解释和机器生成的解释在理解大语言模型输出时,哪个更有效?分类: 解释形式设计与理解效果同类问题arrow_forward
- 错误预测情况下的解释是否会减弱用户的任务表现?分类: 解释形式设计与理解效果同类问题arrow_forward
- “解释确认偏差”在用户信任和认知负担中如何起作用?分类: 解释形式设计与理解效果同类问题arrow_forward
lightbulb
现实痛点
1- 用户难以理解人工智能的决策,尤其是错误的预测,影响任务表现。分类: 解释形式设计与理解效果同类问题arrow_forward
- 83%
分歧去卷积:将机器学习性能指标与现实接轨
CHI '21· 可解释人工智能(XAI) +1
- 71%
通过交互重建评估生成模型的可解释性
CHI '21· 可解释人工智能(XAI) +2
- 71%
LLM-box 与 Thinking-box:设计支持用户主动识别对话搜索中失真信息的研究
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
看不见的破坏者:谄媚型大语言模型在问题解决任务中误导新手
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
响应延迟和任务类型对人类-LLM 交互与感知的影响
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
与我共编还是为我编程?AI 自动化程度提升如何改变开发者工作流
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
探索预训练模型的创新机会
DIS '25· 生成式AI(文本、图像、音乐、视频) +2
- 67%
操纵和测量模型可解释性
CHI '21· 可解释人工智能(XAI) +1
- 67%
共享兴趣:测量人机对齐以识别模型行为中的重复模式
CHI '22· 可解释人工智能(XAI) +1
- 67%
去偏CAM以减轻图像扰动并提供机器学习的忠实可视化解释
CHI '22· 可解释人工智能(XAI) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642934
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、算法透明度与可审计性
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文