当审稿人收到人工智能反馈时会发生什么?

大语言模型(LLM)的人机协作可解释人工智能(XAI)研究伦理与开放科学HCI 研究员大学教授与研究人员

文献标题

What Happens When Reviewers Receive AI Feedback in Their Reviews?

出版信息

  • 主题领域: 人工智能反馈工具在学术同行评审过程中的作用与影响。
  • 关键词: AI反馈,同行评审,ICLR 2025,评审者感知,学术出版,人机协作,评审质量,治理,混合方法研究,学术可持续性。

背景与问题

  • 问题/挑战: 学术会议投稿量的增加正在加剧同行评审系统的压力,导致评审质量不一致以及评审者疲劳。现有的用于同行评审的人工智能工具尚未得到充分探索,尤其是在为评审者提供评审后反馈方面。
  • 重要性: 理解评审者如何看待和回应人工智能反馈,对于设计能够提升评审质量、同时保障人类专业知识和责任感的工具至关重要。
  • 动机与相关研究: 之前的研究主要集中在假设的人工智能场景或评审自动化上。关于评审者在实际高风险环境中如何与人工智能反馈互动的研究较少。本研究基于先前工作,考察了人工智能反馈工具在ICLR 2025中的实际部署情况。

解决方案

  • 提出的方法: 在ICLR 2025中部署并研究一款人工智能反馈工具,该工具为评审者提供评审后建议,以改进评审的清晰度、语气和具体性。
  • 创新点:
    1. 首次对人工智能反馈在实际高风险同行评审过程中的实证研究。
    2. 揭示了同行评审中人机协商的洞察,突出了支持与评估权威之间的张力。
    3. 提出了设计人工智能工具的启示,这些工具能够在提升评审质量的同时保留人类的自主性和责任感。
  • 程序和关键技术:
    • 采用混合方法研究,包括对ICLR 2025评审者的问卷调查(N=51)和访谈(N=9)。
    • 分析评审者的感知、行为以及对人工智能在同行评审中角色的设想。
    • 对定性数据进行主题分析,对调查问卷的响应进行统计分析。

结果

  • 具体发现:
    • 78.4%的问卷参与者在收到人工智能反馈后考虑修改评审,但只有56.9%实际进行了修改。
    • 人工智能反馈被认为是相关的(M = 4.51, p = 0.032)且可操作的(M = 4.22),但建设性较差(M = 3.88),并且偶尔不适当(M = 4.39)。
    • 评审者并未感到人工智能降低了他们的责任感(M = 3.94)或问责感(M = 3.63)。
  • 相较基线的优势: 本研究超越了假设或模拟环境,通过分析评审者与人工智能工具的实际互动,提供了关于其实用影响的可操作见解。
  • 实验/评估:
    • 问卷调查:通过李克特量表和开放式问题评估反馈的有用性、质量以及行为意图。
    • 访谈:半结构化讨论,探索评审者的体验、关切以及对未来人工智能工具的愿景。
    • 参与者:51名问卷受访者和9名访谈对象,主要为具有多样化评审经验的早期职业研究人员。
  • 局限性与未来工作:
    • 样本偏向男性和早期职业研究人员,限制了多样性。
    • 依赖自我报告数据,而非评审质量的客观衡量。
    • 研究结果特定于ICLR 2025;需要在不同场景和评审结构中进行进一步研究。

总结

本研究探讨了人工智能反馈在ICLR 2025评审过程中的影响。尽管评审者承认人工智能工具在提升清晰度和具体性方面有所帮助,但他们通常认为该工具的作用有限,因为其关注于表层表达而非智力评估。研究揭示了一个悖论:评审者采纳了人工智能的建议,但拒绝其权威性,强调需要设计能够与其智力挑战相一致的工具。参与者将人工智能视为推理的协作者、减轻劳动负担的工具以及质量保障的手段,同时强调人类评估判断的重要性。这些发现为设计既能提升评审质量又不削弱评审者自主性的人工智能工具提供了可操作的见解。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222679/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791431
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、研究伦理与开放科学
work
职业/产业
HCI 研究员、大学教授与研究人员
article
内容状态
已索引正文
hub
相关论文
6 篇相关论文