促进对大型语言模型的适当依赖:解释、来源和不一致性的角色

荣誉提名
大语言模型(LLM)的人机协作可解释人工智能(XAI)软件工程师与开发者HCI 研究员认知科学家

研究背景与问题

  • 问题和挑战: 大型语言模型 (LLMs) 的输出可能包含令人信服但实际错误的信息,从而引发用户过度依赖的问题。这种误导可能导致用户基于错误信息采取行动,在高风险场景中尤其危险。
  • 重要性: 随着LLMs在搜索、信息检索等领域的迅速普及,过度依赖问题被认为是人与AI互动中的重要研究议题,其解决直接影响用户能否正确使用这种技术。
  • 研究动机与相关工作: 尽管关于AI依赖的许多前期研究集中于传统AI模型,但针对LLMs的研究仍处于起步阶段。现有工作表明,解释和其他特性可以影响用户对系统的信任,但也发现这些解释可能促进不合理的依赖。该研究旨在从系统生成解释、引用来源及不一致性方面,为缓解过度依赖提供依据。

解决方案

  • 提出方法: 作者通过两项研究:1) 以“思维大声说出”方法了解用户如何看待ChatGPT的响应及其依赖决策受哪些特性影响;2) 设计了大规模、预注册的实验严格控制研究变量,分析影响用户依赖的主要特性。
  • 创新之处: 研究不仅探讨了解释、来源及不一致性的影响,还分析了这些特性之间的交互作用。同时研究采用了真实的LLM输出并构建模拟环境,使实验结果更加贴近实际应用情境。
  • 实施步骤:
    1. 研究设计: 在第一项初步研究中,让 16 名参与者通过与 ChatGPT 多轮交互回答问题,并记录其对解释、不一致性、和来源的观察。
    2. 实验操控: 在第二项实验中,通过实验设计严格控制三个变量(正确/错误答案、解释是否存在、来源是否存在),研究对用户回答准确性、依赖等行为的影响。
    3. 技术手段: 利用 ChatGPT 和 Perplexity AI(一个更注重提供来源的模型)生成实验所需的对话并对解释逻辑进行编码。在实验中对来源点击行为进行了详细跟踪。

研究成果

  • 具体成果:

    1. 提供解释显著性提高了用户依赖,但同时也增强了对错误响应的过度依赖。提供来源则有效降低了过度依赖,改善正确答案的适当依赖行为。不一致的解释减少了用户对错误答案的依赖。
    2. 用户在没有解释或来源时表达了更低的信任和参与度,说明这两个特性在构建信任中具有重要作用。
  • 相较现有解决方案的优势:

    1. 提出了在LLM输出中强调不一致性作为减轻过度依赖的有效策略,为现有只注重“解释可视化”的研究提供了新方向。
    2. 关注来源质量的重要性与影响,提出了基于来源可信度和易用性的设计改进建议。
  • 实验与评估结果:

    • 第一项研究发现用户重视解释、来源,并认为逻辑不一致性是重要的可靠性指示。
    • 第二项实验中用户的答案准确率受不同变量组合影响,其中提供来源显著促进准确决策,而没有解释或不一致解释能减少对错误答案的依赖。
    • 实验证明用户更倾向于以解释作为可信性评判,然而冗长或错误的解释可能“迷惑”用户,导致过度依赖。
  • 局限性与未来方向:

    1. 实验仅限于回答二元问题的任务背景,无法直接推广到其他LLM应用场景(如写作或生成对话)。
    2. 实验设计中源于LLM的错误率被设定为较低,该研究未探讨更高准确率时对依赖影响的变化。
    3. 因实验通过简化交互过程来控制研究变量,未能模拟用户多轮交互场景中的动态变化。

建议未来研究方向:

  • 扩展不一致性对用户其他任务行为(如创作型或复杂推理任务)的影响研究。
  • 深入研究如何优化解释呈现方式,同时减少过度信任对不准确输出的负面影响。
  • 探索如何结合用户背景知识和模型可视化技术提高LLM使用效率。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188664/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714020
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
荣誉提名
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)
work
职业/产业
软件工程师与开发者、HCI 研究员、认知科学家
article
内容状态
已索引正文
hub
相关论文
8 篇相关论文