CoBRA:使用经典社会科学实验对社会智能体进行认知偏差编程

最佳论文
大语言模型(LLM)的人机协作可解释人工智能(XAI)脑机接口(BCI)与神经反馈情感化人机对话AI/ML 研究员与工程师HCI 研究员认知科学家

文献标题

CoBRA: Programming Cognitive Bias in Social Agents Using Classic Social Science Experiments

出版信息

  • 主题领域: 基于LLM的社会模拟中的认知偏差控制
  • 关键词: 认知偏差, 社会代理, LLMs, 行为调控, 可重复性, 框架效应, 权威效应, 从众效应, 确认偏差, 社会科学实验

背景与问题

  • 问题/挑战: 现有的社会模拟中指定代理行为的方法依赖于隐式的自然语言描述,导致模型之间行为的不一致性和不可预测性。这些方法无法可靠地捕捉基于角色的行为差异的细微之处。
  • 重要性: 对代理行为的可靠控制对于可重复的社会模拟至关重要,这些模拟可以用于测试社会理论并在受控且伦理的环境中探索复杂的人类行为。
  • 动机与相关工作: 先前的研究探索了基于LLM的代理建模和对齐,但缺乏系统控制认知偏差的机制。本文通过引入一个工具包,利用经过验证的社会科学实验来调控代理行为,从而填补这一空白。

解决方案

  • 提出的方法: CoBRA(Cognitive Bias Regulator for Social Agents),一个用于显式和量化控制基于LLM的社会代理认知偏差的工具包。
  • 创新点:
    1. 引入一个闭环系统,通过验证的社会科学实验测量和调控认知偏差。
    2. 开发了认知偏差指数(Cognitive Bias Index, CBI)作为偏差控制的量化指标。
    3. 实现了一个行为调控引擎,包含三种干预方法:提示工程、表示工程和微调。
    4. 在模型、温度和推理模式之间展示了可重复性和可控性。
  • 流程与关键技术:
    1. 认知偏差指数(CBI): 使用从经典实验(如“亚洲疾病问题”、“米尔格伦服从实验”)中提取的结构化提示来测量偏差水平。
    2. 行为调控引擎: 使用以下方法对齐代理行为:
      • 提示数值控制:通过数值指令直接指定偏差水平。
      • 表示工程:修改激活空间表示以注入偏差信号。
      • 微调:使用轻量级的LoRA方法调整模型参数。
    3. 在多个范式中评估代理,以确保可重复性和可控性。

结果

  • 具体发现:
    • CoBRA将跨模型的方差降低了77%,相较于基线方法。
    • 控制系数在不同范式间可靠转移(Spearman’s ρ > 0.96)。
    • 表示工程在单调性(NDCG ≈ 1.00)、平滑性(Δ1 = 0.07)和表现力(范围 ≈ 1.8–2.1)之间实现了最佳平衡。
  • 相较基线的优势:
    • 在一致性和可预测性方面显著优于隐式自然语言规范。
    • 在温度(方差 < 1.2%)和推理模式(RepE方法在100%的测试中等效)之间实现了稳定控制。
  • 实验/评估:
    • 在四种认知偏差(权威效应、从众效应、确认偏差、框架效应)中基于八种经典范式进行基准测试。
    • 在开源和闭源模型上进行测试,在仅API可用的设置中表现稳健。
    • 在情绪传染模拟中展示了可预测的剂量-反应关系。
  • 局限性与未来工作:
    • 尚未进行与社会学家的可用性研究。
    • 限于基于语言的模拟;未来工作将探索多模态设置。
    • 目前聚焦于单一偏差控制;组合偏差控制尚未探索。
    • 激活和参数级别的控制仅限于开源模型。

总结

CoBRA引入了一个新颖的框架,通过验证的社会科学实验显式控制基于LLM的社会代理的认知偏差。通过利用认知偏差指数和行为调控引擎,CoBRA确保了模型、温度和推理模式之间的可重复性和精细化行为控制。该工具包在一致性、可预测性和泛化性方面显著优于基线方法。尽管目前局限于基于语言的和单一偏差的模拟,CoBRA为更精确和有影响力的社会科学模拟奠定了基础。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223158/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790804
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
最佳论文
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、脑机接口(BCI)与神经反馈、情感化人机对话
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、认知科学家
article
内容状态
已索引正文
hub
相关论文
5 篇相关论文