依赖还是不依赖?评估对大型语言模型适当依赖的干预措施

荣誉提名
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统

研究背景与问题

  • 问题或挑战: 研究探讨了用户对大语言模型 (LLM) 的依赖行为。用户可能由于模型的自信输出而过度依赖(over-reliance),也可能因对模型的不信任而依赖不足(under-reliance)。此外,如何让用户在适当的情况下信任并使用 LLM 的建议(即“合理依赖”)形成了一个核心挑战。

  • 重要性: 随着 LLM 被广泛集成到各种任务中(如写作、教育、决策支持等),它们的错误可能严重影响人类决策。尤其是,过度依赖可能导致用户接受错误信息,而依赖不足可能错失 LLM 提供的正确建议。

  • 研究动机与相关工作: 之前的研究主要关注是否减少过度依赖,但较少关注如何在维持合理依赖的同时减少错误依赖。与先前人机协作的研究不同,本研究旨在对几种依赖干预措施进行系统的实证评估。

解决方案

  • 提出的方法或解决方案: 作者设计并测试了三种 LLM 依赖干预措施:

    1. Reliance Disclaimer(依赖免责声明):添加静态提醒用户验证信息。
    2. Uncertainty Highlighting(不确定性高亮):可视化标记LLM输出中的不确定部分。
    3. Implicit Answer(隐式答案):以隐藏答案直接输出的方式强迫用户更深入处理建议。

    这些方法分别试图通过增加认知干预和降低用户对模型输出的盲目信任来校准用户的依赖行为。

  • 创新之处: 本研究不仅探讨了减少过度依赖的方法,还通过实验评估是否能促进合理依赖,并通过“用户信心变化”和“时间参与度”等多维度指标探索了如何改善人机协作的效果。

  • 实施步骤与关键技术:

    1. 收集 400 名参与者进行随机对照实验。
    2. 提供两个任务类型:LSAT逻辑推理(多选题)和图像数量估算(数值问题)。
    3. 实验设计分为两个阶段,参与者首先独自完成任务,然后查看修改过的 LLM 输出建议并重新作答。
    4. 数据指标包括依赖合理性(正确/错误依赖)、信心校准(信心变化)和时间参与度。

研究成果

  • 具体成果:

    1. Reliance Disclaimer 在 LSAT 任务中有效提高了合理依赖,同时对时间参与度影响较小。
    2. Uncertainty Highlighting 能减少过度依赖,但也增加了用户对模型建议的犹豫,同时导致主观感知(如准确性和有用性)下降。
    3. Implicit Answer 在一定程度上促使用户更倾向于自主决策,但也增加了计算时间,同时可能因为用户需要额外计算减少了依赖行为。
  • 与现有解决方案的对比及优势: Reliance Disclaimer 是最简便和有效的一种方法,且对用户交互的复杂性增加有限。而其他干预措施虽然减少过度依赖,但引入了更大的时间开销,或降低了用户对 LLM 的感知信任。

  • 实验或评估结果:

    • 在LSAT任务中,Reliance Disclaimer 显著提高了合理依赖指标 ARR(Appropriate Reliance Ratio)。
    • 高亮不确定性效果有限,甚至在某些情况下加剧了对建议的错误判断。
    • 隐式答案在数值估算任务中增加了用户的认知参与,但导致错误依赖(under-reliance)增加。
    • 信心校准较差,用户在过度或错误依赖模型时反而表现出更高的信心。
  • 局限性与未来方向:

    1. 研究未能完全模拟与 LLM 长期和真实交互中的用户行为(如动态任务)。
    2. 仅使用了 GPT-4o 进行实验,结果可能不适用于所有 LLM。
    3. 干预措施可能还存在改进空间,例如高亮不确定部分的替代方法(比如用绿色标记高置信度部分)。
    4. 建议未来在更开放式和生成性任务(如写作或代码生成)中测试干预效果,并结合定性研究更深入挖掘用户对模型建议的实际感受和操作模式。

总结

本研究是对 LLM 用户依赖行为的重要探讨,系统评估了不同干预措施如何影响合理依赖及信心校准。结果表明,简单干预(如依赖免责声明)在一定任务中表现较优,而更复杂的干预可能带来意外效果。未来在扩展研究任务的多样性及模型类型的同时,需要进一步完善用户行为建模与干预设计方法。这一研究为构建更安全、更高效的人机协作系统提供了宝贵的见解。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188670/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714097
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
荣誉提名
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文