从期望到评估:期望线索系统性地影响LLM和人类判断
作者
大语言模型(LLM)的人机协作可解释人工智能(XAI)隐私设计与用户控制医生、护士、临床医生大学教授与研究人员律师与法律研究员AI/ML 研究员与工程师
文献标题
From Expectation to Evaluation: Expectation Cues Systematically Bias LLM and Human Judgment
出版信息
- 主题领域: 期望线索对人类和大型语言模型(LLMs)评估判断的影响。
- 关键词: 期望线索、判断偏差、LLM评估、人机交互、决策支持、认知偏差、启动效应、公平性、透明性、评估偏差。
背景与问题
- 问题/挑战: 先前研究表明,期望线索(例如来源标签、专业信号)会影响人类判断,但尚不清楚LLMs是否表现出类似的偏差,以及这些偏差与人类模式的比较情况。
- 重要性: 在医疗、教育、法律等高风险领域中,理解LLMs中的期望驱动偏差对于确保公平性、可靠性和透明性至关重要。
- 动机与相关研究: 尽管已有研究表明LLMs对语境信号(如语气和礼貌)具有敏感性,但其对期望线索的敏感性以及与人类偏差的结构性相似性尚未被探索。本研究通过在受控条件下系统比较人类与LLMs来填补这一研究空白。
解决方案
- 提出的方法: 通过两项实验和额外的链式思维(Chain-of-Thought, CoT)推理条件,系统研究人类和LLMs中的期望驱动偏差。
- 创新点:
- 开发匹配的实验范式,以在相同条件下比较人类和LLMs的评估判断。
- 引入期望线索作为影响评估的语境先验,将经典认知理论扩展到人工系统。
- 提供人类与LLMs在判断调整模式上的共同点和差异的实证证据。
- 探索链式思维推理对减轻LLMs中期望驱动偏差的影响。
- 程序与关键技术:
- 两项实验采用因子设计,操控期望水平(高、中、低、无)和建议质量(高、中、低)。
- 实验1:评估者在接收到期望线索后对建议进行判断。
- 实验2:评估者在两次评估之间接收到期望线索后重新评估建议。
- 额外实验:引入链式思维推理以测试其对偏差的影响。
- 使用标准化提示和评估指标比较人类评估者与三种LLMs(GPT-4o、Llama-3.3-70B、DeepSeek-r1)。
结果
- 具体发现:
- 期望线索系统性地影响了人类和LLMs的评估判断,较高的期望导致更为积极的评估。
- 期望与建议质量之间的较大不匹配加剧了判断偏差。
- 人类对负面期望违背表现出不对称的抵抗,而LLMs对正面和负面违背均表现出对称的调整。
- 链式思维推理未能减轻LLMs中的期望驱动偏差。
- 人类在声明的意图与实际判断变化之间存在差异,而LLMs在报告输出与观察结果之间完全一致。
- 相较基线的优势: 本研究首次系统比较了人类与LLMs中的期望驱动偏差,揭示了判断模式的结构性相似性和差异。
- 实验/评估:
- 实验1:每种模式(人类和三种LLMs)在12种条件下进行720次评估。
- 实验2:采用两阶段评估设计,每种模式进行540次评估。
- 额外实验:使用相同的LLMs和条件测试链式思维推理。
- 指标:判断分数(J)、期望量表(E)和判断变化(ΔJ)。
- 局限性与未来工作:
- 由于众包设置,人类评估的深度有限。
- 在受控环境中的短期响应可能无法推广到现实世界中的长期交互。
- 单语言、仅文本的语境限制了其在多模态或文化多样性环境中的适用性。
- 未来工作应探索诸如期望校准界面和中性框架模板等减轻偏差的策略。
总结
本研究表明,期望线索系统性地影响了人类和LLMs的评估判断,较高的期望导致更为积极的评估,而较大的不匹配加剧了偏差。人类与LLMs表现出共同点和差异,其中LLMs对期望违背表现出一致且对称的响应。链式思维推理未能减轻LLMs中的偏差。这些发现强调了在设计公平透明的人机交互时考虑期望线索的重要性,并为开发AI系统中的偏差减轻策略提供了研究机会。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790492
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、隐私设计与用户控制
work
职业/产业
医生、护士、临床医生、大学教授与研究人员、律师与法律研究员、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文