促进对大型语言模型的适当依赖:解释、来源和不一致性的角色
荣誉提名作者
大语言模型(LLM)的人机协作可解释人工智能(XAI)软件工程师与开发者HCI 研究员认知科学家
研究背景与问题
- 问题和挑战: 大型语言模型 (LLMs) 的输出可能包含令人信服但实际错误的信息,从而引发用户过度依赖的问题。这种误导可能导致用户基于错误信息采取行动,在高风险场景中尤其危险。
- 重要性: 随着LLMs在搜索、信息检索等领域的迅速普及,过度依赖问题被认为是人与AI互动中的重要研究议题,其解决直接影响用户能否正确使用这种技术。
- 研究动机与相关工作: 尽管关于AI依赖的许多前期研究集中于传统AI模型,但针对LLMs的研究仍处于起步阶段。现有工作表明,解释和其他特性可以影响用户对系统的信任,但也发现这些解释可能促进不合理的依赖。该研究旨在从系统生成解释、引用来源及不一致性方面,为缓解过度依赖提供依据。
解决方案
- 提出方法: 作者通过两项研究:1) 以“思维大声说出”方法了解用户如何看待ChatGPT的响应及其依赖决策受哪些特性影响;2) 设计了大规模、预注册的实验严格控制研究变量,分析影响用户依赖的主要特性。
- 创新之处: 研究不仅探讨了解释、来源及不一致性的影响,还分析了这些特性之间的交互作用。同时研究采用了真实的LLM输出并构建模拟环境,使实验结果更加贴近实际应用情境。
- 实施步骤:
- 研究设计: 在第一项初步研究中,让 16 名参与者通过与 ChatGPT 多轮交互回答问题,并记录其对解释、不一致性、和来源的观察。
- 实验操控: 在第二项实验中,通过实验设计严格控制三个变量(正确/错误答案、解释是否存在、来源是否存在),研究对用户回答准确性、依赖等行为的影响。
- 技术手段: 利用 ChatGPT 和 Perplexity AI(一个更注重提供来源的模型)生成实验所需的对话并对解释逻辑进行编码。在实验中对来源点击行为进行了详细跟踪。
研究成果
-
具体成果:
- 提供解释显著性提高了用户依赖,但同时也增强了对错误响应的过度依赖。提供来源则有效降低了过度依赖,改善正确答案的适当依赖行为。不一致的解释减少了用户对错误答案的依赖。
- 用户在没有解释或来源时表达了更低的信任和参与度,说明这两个特性在构建信任中具有重要作用。
-
相较现有解决方案的优势:
- 提出了在LLM输出中强调不一致性作为减轻过度依赖的有效策略,为现有只注重“解释可视化”的研究提供了新方向。
- 关注来源质量的重要性与影响,提出了基于来源可信度和易用性的设计改进建议。
-
实验与评估结果:
- 第一项研究发现用户重视解释、来源,并认为逻辑不一致性是重要的可靠性指示。
- 第二项实验中用户的答案准确率受不同变量组合影响,其中提供来源显著促进准确决策,而没有解释或不一致解释能减少对错误答案的依赖。
- 实验证明用户更倾向于以解释作为可信性评判,然而冗长或错误的解释可能“迷惑”用户,导致过度依赖。
-
局限性与未来方向:
- 实验仅限于回答二元问题的任务背景,无法直接推广到其他LLM应用场景(如写作或生成对话)。
- 实验设计中源于LLM的错误率被设定为较低,该研究未探讨更高准确率时对依赖影响的变化。
- 因实验通过简化交互过程来控制研究变量,未能模拟用户多轮交互场景中的动态变化。
建议未来研究方向:
- 扩展不一致性对用户其他任务行为(如创作型或复杂推理任务)的影响研究。
- 深入研究如何优化解释呈现方式,同时减少过度信任对不准确输出的负面影响。
- 探索如何结合用户背景知识和模型可视化技术提高LLM使用效率。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 用户如何根据解释、引用来源和一致性等特性决定对大语言模型(LLMs)的信任程度?分类: LLM 信任与过度/不足依赖同类问题arrow_forward
- 系统解释、引用来源和输出一致性如何影响用户对错误和正确信息的依赖?分类: LLM 信任与过度/不足依赖同类问题arrow_forward
- 加强输出质量中的不一致性展示是否能有效降低用户对错误输出的过度依赖?分类: LLM 信任与过度/不足依赖同类问题arrow_forward
lightbulb
现实痛点
1- 用户容易对大语言模型的错误信息过度信任,导致决策失误。分类: LLM 信任与过度/不足依赖同类问题arrow_forward
- 80%
EvAlignUX:通过LLM支持的指标探索提升用户体验评估
CHI '25· 大语言模型(LLM)的人机协作 +1
- 67%
'为什么《芝加哥》是误导性的?' 为人类构建模型驱动教程的尝试
CHI '20· 大语言模型(LLM)的人机协作 +2
- 67%
为何及何时基于LLM的助手会出错:基于提示的软件求助交互有效性研究
IUI '24· 大语言模型(LLM)的人机协作 +1
- 67%
ViseGPT: 实现 LLM 生成的数据整理脚本与用户提示的更好对齐
UIST '25· 大语言模型(LLM)的人机协作 +2
- 60%
COGAM:在机器学习模型解释中测量和调节认知负荷
CHI '20· 可解释人工智能(XAI)
- 60%
持续的人在环优化
CHI '25· 大语言模型(LLM)的人机协作
- 60%
MAPLE:利用大型语言模型嵌入的移动应用预测
UbiComp '24· 大语言模型(LLM)的人机协作
- 60%
LlamaTouch:一个可信且可扩展的移动UI任务自动化测试平台
UIST '24· 大语言模型(LLM)的人机协作
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714020
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
荣誉提名
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)
work
职业/产业
软件工程师与开发者、HCI 研究员、认知科学家
article
内容状态
已索引正文
hub
相关论文
8 篇相关论文