依赖还是不依赖?评估对大型语言模型适当依赖的干预措施
荣誉提名研究背景与问题
-
问题或挑战: 研究探讨了用户对大语言模型 (LLM) 的依赖行为。用户可能由于模型的自信输出而过度依赖(over-reliance),也可能因对模型的不信任而依赖不足(under-reliance)。此外,如何让用户在适当的情况下信任并使用 LLM 的建议(即“合理依赖”)形成了一个核心挑战。
-
重要性: 随着 LLM 被广泛集成到各种任务中(如写作、教育、决策支持等),它们的错误可能严重影响人类决策。尤其是,过度依赖可能导致用户接受错误信息,而依赖不足可能错失 LLM 提供的正确建议。
-
研究动机与相关工作: 之前的研究主要关注是否减少过度依赖,但较少关注如何在维持合理依赖的同时减少错误依赖。与先前人机协作的研究不同,本研究旨在对几种依赖干预措施进行系统的实证评估。
解决方案
-
提出的方法或解决方案: 作者设计并测试了三种 LLM 依赖干预措施:
- Reliance Disclaimer(依赖免责声明):添加静态提醒用户验证信息。
- Uncertainty Highlighting(不确定性高亮):可视化标记LLM输出中的不确定部分。
- Implicit Answer(隐式答案):以隐藏答案直接输出的方式强迫用户更深入处理建议。
这些方法分别试图通过增加认知干预和降低用户对模型输出的盲目信任来校准用户的依赖行为。
-
创新之处: 本研究不仅探讨了减少过度依赖的方法,还通过实验评估是否能促进合理依赖,并通过“用户信心变化”和“时间参与度”等多维度指标探索了如何改善人机协作的效果。
-
实施步骤与关键技术:
- 收集 400 名参与者进行随机对照实验。
- 提供两个任务类型:LSAT逻辑推理(多选题)和图像数量估算(数值问题)。
- 实验设计分为两个阶段,参与者首先独自完成任务,然后查看修改过的 LLM 输出建议并重新作答。
- 数据指标包括依赖合理性(正确/错误依赖)、信心校准(信心变化)和时间参与度。
研究成果
-
具体成果:
- Reliance Disclaimer 在 LSAT 任务中有效提高了合理依赖,同时对时间参与度影响较小。
- Uncertainty Highlighting 能减少过度依赖,但也增加了用户对模型建议的犹豫,同时导致主观感知(如准确性和有用性)下降。
- Implicit Answer 在一定程度上促使用户更倾向于自主决策,但也增加了计算时间,同时可能因为用户需要额外计算减少了依赖行为。
-
与现有解决方案的对比及优势: Reliance Disclaimer 是最简便和有效的一种方法,且对用户交互的复杂性增加有限。而其他干预措施虽然减少过度依赖,但引入了更大的时间开销,或降低了用户对 LLM 的感知信任。
-
实验或评估结果:
- 在LSAT任务中,Reliance Disclaimer 显著提高了合理依赖指标 ARR(Appropriate Reliance Ratio)。
- 高亮不确定性效果有限,甚至在某些情况下加剧了对建议的错误判断。
- 隐式答案在数值估算任务中增加了用户的认知参与,但导致错误依赖(under-reliance)增加。
- 信心校准较差,用户在过度或错误依赖模型时反而表现出更高的信心。
-
局限性与未来方向:
- 研究未能完全模拟与 LLM 长期和真实交互中的用户行为(如动态任务)。
- 仅使用了 GPT-4o 进行实验,结果可能不适用于所有 LLM。
- 干预措施可能还存在改进空间,例如高亮不确定部分的替代方法(比如用绿色标记高置信度部分)。
- 建议未来在更开放式和生成性任务(如写作或代码生成)中测试干预效果,并结合定性研究更深入挖掘用户对模型建议的实际感受和操作模式。
总结
本研究是对 LLM 用户依赖行为的重要探讨,系统评估了不同干预措施如何影响合理依赖及信心校准。结果表明,简单干预(如依赖免责声明)在一定任务中表现较优,而更复杂的干预可能带来意外效果。未来在扩展研究任务的多样性及模型类型的同时,需要进一步完善用户行为建模与干预设计方法。这一研究为构建更安全、更高效的人机协作系统提供了宝贵的见解。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 如何设计干预措施以减少用户对大型语言模型(LLM)的过度依赖或不足依赖?分类: LLM 信任与过度/不足依赖同类问题arrow_forward
- 不同干预措施(如依赖免责声明、不确定性标注和隐式回答)如何影响用户信任与合理依赖行为?分类: LLM 信任与过度/不足依赖同类问题arrow_forward
- 哪些因素影响用户在不同任务类型中对LLM建议的信任校准?分类: LLM 信任与过度/不足依赖同类问题arrow_forward
现实痛点
1- 用户无法恰当地信任LLM导致错误决策或错失机会。分类: LLM 信任与过度/不足依赖同类问题arrow_forward
- 100%
重新思考交互:从工具性交互到人机合作
CHI '18· 大语言模型(LLM)的人机协作 +1
- 100%
先计划后执行:一项关于用户信任和团队表现的经验研究,当使用LLM代理作为日常助手时
CHI '25· 大语言模型(LLM)的人机协作 +1
- 100%
通过LLM驱动的魔鬼代言人增强AI辅助群体决策
IUI '24· 大语言模型(LLM)的人机协作 +1
- 100%
C-PAK:纠正和补全基于可变长度前缀的缩写击键
UIST '23· 大语言模型(LLM)的人机协作 +1
- 67%
使用数字记录员自动化临床文档:理解对医生的影响
CHI '21· 大语言模型(LLM)的人机协作 +1
- 67%
统一对话模型中系统发起的闲聊与任务导向对话之间的转换
CUI '23· 对话式聊天机器人 +2
- 67%
TiiS:交互式机器学习的用户界面设计综述
IUI '19· 大语言模型(LLM)的人机协作 +2
- 67%
通过短言语反应时间诱导多智能体决策交互中的主动态度
IUI '19· 会话代理的人格与拟人化 +2
- 67%
探索机器学习素养干预对普通人依赖机器学习模型的影响
IUI '22· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)