LLM在价值导向话题的建设性论证中使价值观同质化
大语言模型(LLM)的人机协作AI 伦理、公平与问责算法公平与偏见科技伦理与批判性HCIHCI 研究员AI/ML 研究员与工程师社会学家与人类学家
文献标题
LLMs Homogenize Values in Constructive Arguments on Value-Laden Topics
出版信息
- 主题领域: 大型语言模型(LLMs)对敏感话题中建设性讨论的价值框架影响。
- 关键词: LLMs, 价值同质化, 建设性讨论, 亲社会价值, 保守价值, 文化差异, 恐同, 伊斯兰恐惧症, GPT-4, 伦理AI。
背景与问题
- 问题/挑战: 对LLMs在重写涉及敏感价值话题的论点时如何处理和重塑潜在价值的理解有限。先前研究主要关注语言上的建设性,而非价值对齐。
- 重要性: 随着LLMs越来越多地用于调解在线讨论,理解其如何影响价值框架至关重要,因为这可能影响包容性、公平性以及多元观点的表达。
- 动机与相关工作: 尽管研究表明LLMs能够提升语言建设性,但它们往往与人类价值观不一致,倾向于支持亲社会和进步的取向,而非保守取向。本研究通过系统分析LLMs在分裂性话题中重写评论时的价值转变,填补了这一研究空白。
解决方案
- 提出的方法: 通过三阶段研究,调查LLMs(GPT-4)在重写涉及价值话题的评论时如何影响价值框架及其与人类价值的感知对齐。
- 创新点:
- 使用Schwartz基本人类价值理论系统分析LLMs重写评论中的价值转变。
- 检查LLMs如何改变立场和价值框架,通常将讨论引导至亲社会方向。
- 跨文化评估人类与LLMs重写评论之间的感知对齐。
- 过程与关键技术:
- 第1阶段:收集了印度和美国参与者在恐同和伊斯兰恐惧症话题上的234条评论,并分析其价值框架。
- 第2阶段:使用GPT-4建设性地重写这些评论,比较人类撰写和LLMs重写版本的语言和价值特征。
- 第3阶段:进行强制选择实验,让参与者评估哪些评论(人类或LLMs重写)更符合他们的价值观。
结果
- 具体发现:
- LLMs系统性地弱化了保守价值(如传统、安全、遵从),并强化了亲社会价值(如普遍主义、仁慈)。
- LLM重写的评论经常改变立场,使反对同性婚姻或伊斯兰的评论变得更中立或支持。
- LLM重写的评论在语言建设性方面表现更佳(如可读性、礼貌性、推理标记)相比人类撰写的评论。
- 相较基线的优势:
- 支持同性婚姻或伊斯兰的参与者认为LLMs重写的评论更符合其价值观(整体偏好率为59.9%-61.1%)。
- 然而,反对这些话题的参与者更偏好人类撰写的评论,认为其更符合保守价值。
- 实验/评估:
- 参与者:第1和第2阶段共465名印度和美国参与者;第3阶段额外招募180名参与者。
- 指标:Schwartz价值类别、语言建设性特征、感知价值对齐。
- 话题:恐同和伊斯兰恐惧症,因其分裂性和价值导向性而被选择。
- 局限性与未来工作:
- 仅限于两个文化(印度、美国)和两个话题(恐同、伊斯兰恐惧症);结果可能无法推广至其他情境。
- 研究集中于GPT-4;未来应探索其他LLMs及多语言环境。
- 由于招募限制(Prolific的有害内容预筛选器),样本具有非代表性。
总结
本研究表明,LLMs在重写涉及价值话题的评论时系统性地同质化价值,弱化保守价值并强调普遍主义和仁慈等亲社会价值。这虽然提升了语言建设性并与进步观点对齐,但可能边缘化保守视角并改变立场。跨文化实验显示,LLMs重写的评论更能引起支持同性婚姻或伊斯兰参与者的共鸣,但疏远了反对这些话题的参与者。这些发现突显了在敏感讨论中部署LLMs的伦理和社会政治挑战,强调了AI调解交流中的透明性、个性化和用户控制的必要性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 86%
当刻板印象GTG:预测性文本建议对人与AI协作写作中性别偏见的影响
CHI '26· 大语言模型(LLM)的人机协作 +2
- 86%
超越微软和孟山都:去化计算中的单作隐喻
CHI '26· AI 伦理、公平与问责 +2
- 75%
生活在他们的乌托邦中:为什么算法系统产生荒谬的结果
CHI '21· AI 伦理、公平与问责 +2
- 75%
机器中的心灵?人工智能中意识感的跨学科认知
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
通过创意实践揭示大型语言模型的意识形态
DIS '25· 大语言模型(LLM)的人机协作 +2
- 63%
算法污名化概念化
CHI '23· AI 伦理、公平与问责 +2
- 63%
生成幽灵:预测AI余生的益处与风险
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 63%
视角问题:对比人类和大型语言模型在微妙性别歧视主观决策中的论证
CHI '25· 大语言模型(LLM)的人机协作 +2
- 63%
为善资助AI:呼唤有意义的参与
CHI '26· AI 伦理、公平与问责 +2
- 63%
表层偏见:头像外观如何影响AI招聘感知
CHI '26· AI 伦理、公平与问责 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791624
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 伦理、公平与问责、算法公平与偏见、科技伦理与批判性HCI
work
职业/产业
HCI 研究员、AI/ML 研究员与工程师、社会学家与人类学家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文