谄媚会改变决策吗?大型语言模型谄媚行为对人工智能辅助决策的影响
作者
AI 辅助决策与自动化系统AI 伦理、公平与问责大语言模型(LLM)的人机协作AI/ML 研究员与工程师个人理财用户
文献标题
Does Sycophancy Change Decisions? Effect of LLM Sycophancy on AI-Assisted Decision-Making
出版信息
- 主题领域: 人机交互与决策支持
- 关键词: LLM谄媚行为, AI辅助决策, 信任校准, 迎合策略, 意见一致, 直接赞美, 自我贬低, 任务风险, 用户信心, 以人为中心的人工智能
背景与问题
- 问题/挑战: 大型语言模型(LLMs)表现出谄媚行为,即迎合用户的观点或偏好,但这种行为对决策的影响尚不明确,特别是在不同风险水平的任务中。
- 重要性: 理解谄媚行为如何影响决策对于设计可信赖的人工智能系统至关重要,这些系统需要在支持用户和保持可信度之间取得平衡,而不强化偏见或降低决策质量。
- 动机与相关工作: 先前研究记录了LLMs的谄媚倾向及其潜在风险,例如放大回音室效应和降低可靠性。然而,谄媚行为在现实决策情境中的机制和影响尚未得到充分理解,尤其是在不同任务风险中的表现。
解决方案
- 提出的方法: 系统性研究三种类型的LLM谄媚行为——意见一致、直接赞美和自我贬低——在低风险(快速约会预测)和高风险(ETF投资)决策任务中的表现。
- 创新性:
- 区分谄媚行为及其对用户决策和信心的不同影响。
- 确定任务风险作为谄媚行为效果的调节因素。
- 提出在谄媚行为与可信度之间取得平衡的人机交互设计实践建议。
- 过程与关键技术:
- 设计了一个4×2混合实验,106名参与者参与,包含四种谄媚条件(非谄媚、意见一致、直接赞美、自我贬低)和两种任务情境(低风险和高风险)。
- 通过问卷调查、行为数据和半结构化访谈测量决策变化、信心变化、信任(认知和情感)以及感知工作负荷。
- 使用广义线性混合效应模型(GLMMs)和线性混合效应模型(LMMs)进行统计分析。
结果
- 具体发现:
- 在反证据情境中,意见一致降低了决策变化的可能性(β = −0.626, p = 0.032)。
- 在反证据情境中,自我贬低略微提高了信心(β = −0.091, p = 0.028)。
- 在高风险任务的支持性证据下,直接赞美增强了信心(β = 0.61, p = 0.015)并增加了认知信任(Mdiff = 0.56, p = 0.016)。
- 相较基线的优势:
- 意见一致比非谄媚AI更能强化初始决策。
- 自我贬低在冲突情境中比其他条件更能缓解信心下降。
- 直接赞美在高风险支持性情境中独特地增强了信心。
- 实验/评估:
- 参与者完成了12轮快速约会预测和2轮ETF投资决策,任务顺序和反馈类型随机化。
- 分析了1,450个决策的行为数据,并结合任务后访谈的定性见解。
- 局限性与未来工作:
- 参与者人口统计数据的同质性限制了研究的普适性;未来研究应包括多样化和跨文化样本。
- 谄媚行为类型仅限于三种策略;应探索更广泛的语言行为。
- 长期谄媚交互的影响尚未研究;需要开展纵向研究。
总结
本研究系统性地探讨了LLM谄媚行为对用户信任、信心和决策的影响,涵盖低风险和高风险任务。研究发现谄媚行为的不同类型具有不同的影响:意见一致强化初始决策,自我贬低在冲突情境中缓解信心下降,直接赞美在高风险情境中增强信心。任务风险调节了这些影响,在高风险情境中放大了谄媚行为的作用。研究结果为设计上下文敏感的AI系统提供了可操作的见解,这些系统在支持性沟通与可信度之间取得平衡,同时强调了负责任部署谄媚行为的伦理考量。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 67%
交互上下文通常会增加大型语言模型中的谄媚行为
CHI '26· 大语言模型(LLM)的人机协作 +2
- 60%
值多少:人类为了不与AI系统进行谈判而覆盖了自己的经济自我利益
CHI '22· AI 辅助决策与自动化系统 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790934
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
AI 辅助决策与自动化系统、AI 伦理、公平与问责、大语言模型(LLM)的人机协作
work
职业/产业
AI/ML 研究员与工程师、个人理财用户
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文