使用 GPT 对话智能体模拟人群选择行为与偏见
荣誉提名大语言模型(LLM)的人机协作可解释人工智能(XAI)AI 辅助决策与自动化系统AI 伦理、公平与问责AI/ML 研究员与工程师HCI 研究员认知科学家
文献标题
Emulating Aggregate Human Choice Behavior and Biases with GPT Conversational Agents
出版信息
- 主题领域: 决策中的认知偏差及其通过大语言模型(LLMs)的模拟。
- 关键词: 认知偏差,现状偏差,大语言模型,GPT-4,GPT-5,会话代理,决策,人类行为建模,认知负荷,人类化提示。
背景与问题
- 问题/挑战: 先前研究表明,LLMs 能在孤立环境中再现认知偏差,但其在受认知负荷影响的会话上下文中模拟人类决策偏差的能力尚未被探索。
- 意义: 理解 LLMs 如何模拟人类偏差对于设计适应性强、对偏差敏感的人工智能系统至关重要,这些系统可在电子商务、医疗保健和政策制定等真实场景中有效互动。
- 动机与相关工作: 之前的研究已证明 LLMs 能够在单次或非交互环境中复制类人对话和认知偏差。然而,这些研究缺乏对偏差如何与对话复杂性和认知负荷等上下文因素交互的探讨。本文通过研究 LLMs 是否能够在会话上下文中以概率方式模拟人类决策偏差,填补了这一空白。
解决方案
- 提出的方法: 本研究探讨 LLMs(GPT-4 和 GPT-5)是否能够在受认知负荷影响的会话环境中模拟人类决策偏差,尤其是现状偏差。研究采用人类基线实验和具有不同人类化提示水平的 LLM 模拟。
- 创新点:
- 实证研究 LLMs 在会话上下文中模拟人类决策偏差的能力。
- 分析认知负荷如何影响人类和 LLM 的偏差反应。
- 引入人类化提示以测试 LLMs 与人类行为的一致性。
- 比较不同模型和提示下的 LLM 性能,以评估预测准确性和偏差再现能力。
- 研究流程与关键技术:
- 通过聊天机器人介导的决策场景在人类实验中建立现状偏差的基线(N=1100),测试简单和复杂对话条件。
- 使用 GPT-4 和 GPT-5 模拟人类参与者,利用人口统计数据和先前对话记录。
- 在三个不同人类化提示水平下评估 LLMs 的预测准确性及其在个体和样本层面再现人类偏差的能力。
- 进行消融和扰动研究,以识别影响 LLM 行为的关键因素。
结果
- 具体发现:
- 在决策场景中,人类参与者表现出强烈的现状偏差,当选项被框定为现状时,选择率显著增加(例如,在预算分配场景中为 51% 对比 14%,p < 0.001)。
- 在中性提示(HL1 和 HL2)下,LLMs 在样本层面高精度再现了人类偏差,但在显式偏差易感性提示(HL3)下高估了偏差。
- 复杂对话引发的认知负荷显著增加了感知的心理需求和努力(NASA-TLX 分数:心理需求 = 3.28 对比 1.97,p < 0.001)。
- LLMs 在模拟个体特定的决策倾向方面能力有限,更依赖于对话任务和决策场景中的一般模式。
- 相较基线的优势:
- GPT-4.1 模型表现出更高的精确度(高达 68.5%)和与人类偏差更好的一致性,相较于 GPT-5 模型。
- 人类化提示(HL1 和 HL2)在不发生过拟合的情况下改善了样本层面的偏差再现能力,而 HL3 则未能达到这一效果。
- 实验/评估:
- 人类实验在简单和复杂对话条件下测试了三个决策场景(预算分配、投资组合、大学兼职)的现状偏差。
- LLM 模拟在不同人类化提示下复制了实验设置,并分析了预测准确性、偏差再现能力和上下文交互。
- 使用统计模型(GLMM)和诸如精确度、召回率、F1 分数等指标评估人类与 LLM 响应之间的一致性。
- 局限性与未来工作:
- 由于决策场景的抽象性,研究结果可能无法推广到真实世界的特定领域对话。
- 研究仅关注现状偏差,其他偏差(如锚定效应和框架效应)需要进一步研究。
- 认知负荷通过自我报告和行为指标评估;未来研究可结合生理测量以实现实时评估。
- 实验仅限于 GPT-4 和 GPT-5 模型;需要在其他 LLMs 上进行更广泛的基准测试。
总结
本研究表明,LLMs 能够在受认知负荷影响的会话上下文中模拟人类决策偏差,尤其是现状偏差。人类实验建立了偏差的基线,而 LLM 模拟在中性提示下表现出高精度的样本层面偏差再现能力。然而,LLMs 在捕捉个体特定倾向方面表现欠佳,并在显式偏差易感性提示下高估了偏差。研究结果突显了 LLMs 在现实行为模拟和适应性、偏差敏感系统中的潜力,但需要进一步研究以推广至其他偏差和真实应用场景。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 86%
关于认知:人类能力的一种错觉可能会妨碍对AI系统的适当依赖
CHI '23· 可解释人工智能(XAI) +2
- 86%
两个人的头脑是否比一个人在AI辅助决策中更好?比较群体和个人在人类-AI协作再犯风险评估中的行为和表现
CHI '23· 大语言模型(LLM)的人机协作 +2
- 86%
以人为本的人工智能是什么意思?研究领域的地图
CHI '23· 大语言模型(LLM)的人机协作 +2
- 86%
理解多智能体集体中的遵从与转化动态
CHI '26· 大语言模型(LLM)的人机协作 +2
- 86%
协作强化学习综述:交互方法与设计模式
DIS '21· 大语言模型(LLM)的人机协作 +2
- 86%
谁需要什么样的解释?用户特质如何影响人工智能辅助决策中解释的有效性
IUI '26· AI 辅助决策与自动化系统 +2
- 75%
解释、公平性和人类-AI决策中的适当依赖
CHI '24· 可解释人工智能(XAI) +2
- 71%
'为什么《芝加哥》是误导性的?' 为人类构建模型驱动教程的尝试
CHI '20· 大语言模型(LLM)的人机协作 +2
- 71%
你使我完整:人类-人工智能团队与互补专长
CHI '22· 大语言模型(LLM)的人机协作 +1
- 71%
远见: 在AI应用原型设计期间培养负责任的AI意识
CHI '24· 可解释人工智能(XAI) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791835
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
2 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI 辅助决策与自动化系统、AI 伦理、公平与问责
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、认知科学家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文