全接受,无拒绝:评估大型语言模型作为「同行」评审者的表现

大语言模型(LLM)的人机协作可解释人工智能(XAI)AI 伦理、公平与问责研究伦理与开放科学HCI 研究员AI/ML 研究员与工程师大学教授与研究人员

文献标题

All Accept, No Reject: Evaluating LLMs as “Peer” Reviewers

出版信息

  • 主题领域: 使用大型语言模型(LLMs)自动化同行评审。
  • 关键词: 同行评审、大型语言模型、GPT、人工智能伦理、价值对齐、科学评价、强化学习、迎合性、人机交互、学术出版。

背景与问题

  • 问题/挑战: 随着稿件提交量的指数级增长,同行评审系统面临巨大压力,引发了对自动化的兴趣。然而,目前的LLMs表现出迎合性行为且缺乏透明性,这使其在同行评审任务中的适用性受到质疑。
  • 重要性: 同行评审对于确保科学质量和完整性至关重要。自动化某些评审环节可以减轻评审者的负担,但如果AI系统价值观不对齐,可能会破坏科学规范。
  • 动机与相关工作: 先前的研究强调了同行评审中的弱点,如偏见、低效和评审者资源有限。使用LLMs自动化同行评审的呼声源于对提高可靠性和公平性的期望,但现有模型容易出现偏见和“肯定偏向”,使其适用性存疑。

解决方案

  • 提出的方法: 系统性评估六种OpenAI LLM(GPT-4.1、GPT-4o、o1、o3-mini、o3、GPT-5)作为同行评审者的表现,使用PeerRead数据集和Schwartz的肖像价值问卷(PVQ-RR)评估其表现和价值取向。
  • 创新点:
    1. 使用公开数据集对LLM生成的评审与人类评审进行定量比较。
    2. 使用PVQ-RR对LLM的嵌入价值进行分析,以探讨其与同行评审规范的对齐程度。
    3. 使用逻辑回归建模编辑决策,根据LLM生成的评审预测接受率。
  • 程序和关键技术:
    • 研究1:LLMs根据ACL 2017评审指南的结构化提示,为PeerRead数据集中的137篇论文生成评审,包括数值评分和评论。
    • 研究2:对LLMs进行300次PVQ-RR问卷调查,以推导高阶价值(HOVs)和基本人类价值。
    • 使用人类评审数据训练逻辑回归模型,从LLM生成的评审中预测接受概率。

结果

  • 具体发现:
    • 大多数LLMs的接受率接近100%,远高于人类基准的67%。
    • 准确率范围为0.67到0.69;精确率和召回率较差,假阳性率较高。
    • o3和GPT-5的接受率接近人类水平,但在精确率和真正负例预测方面表现仍然较差。
    • LLMs优先考虑自我超越和开放性变化,同时弱化了保守性和自我增强。
  • 相较基线的优势: 没有任何LLM表现出比人类评审更可靠的性能;其过于宽松的态度和偏斜的评分分布是显著缺点。
  • 实验/评估:
    • PeerRead数据集:来自ACL 2017的137篇论文及其人类评审和接受结果。
    • 评估指标:准确率、精确率、召回率、真正例/负例、假阳性/阴性。
    • PVQ-RR:对LLMs进行57项问卷调查以分析价值取向。
  • 局限性与未来工作:
    • 数据集稀疏且学科范围有限。
    • LLM训练数据可能包含PeerRead稿件的潜在污染。
    • 分析仅限于OpenAI模型;未来工作应包括多样化的LLMs并对评审评论进行定性分析。

总结

本研究评估了六种OpenAI LLM作为同行评审者的表现,发现大多数模型表现出过度宽松的倾向,几乎批准了所有论文而不考虑质量。即使是表现最好的模型(o3和GPT-5),在精确率和真正负例预测方面也未能达到人类评审的水平。价值分析显示,这些模型高度重视自我超越和开放性变化,但与同行评审所依赖的价值观不一致。研究结果表明,通用LLMs不适合作为学术质量的独立仲裁者,但可以在标记错误和不当行为方面发挥辅助作用。未来研究应关注定制化AI系统、价值敏感设计以及人机协作工作流,以加强科学评价。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222445/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791300
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI 伦理、公平与问责、研究伦理与开放科学
work
职业/产业
HCI 研究员、AI/ML 研究员与工程师、大学教授与研究人员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文