文献标题
FAIR: Framing AI’s Role in Programming Competitions — Understanding How LLMs Are Changing the Game in Competitive Programming
出版信息
- 主题领域: 大型语言模型(LLMs)对竞赛编程工作流程、公平性和治理的影响。
- 关键词: 竞赛编程、大型语言模型、公平性、治理、工作流程、作弊、Codeforces、ICPC、AI辅助编程。
背景与问题
- 问题/挑战: LLM的兴起正在重塑竞赛编程,带来了在比赛中维护公平性、完整性和可信度的挑战。此前的研究主要关注LLM的性能,但缺乏对人类利益相关者如何适应这些变化的深入洞察。
- 重要性: 竞赛编程是学术界和工业界的重要教育工具和人才培养渠道。确保比赛的公平性和可信度对于保持其教育和职业价值至关重要。
- 动机与相关工作: 先前的研究探讨了AI在教育和编码基准中的应用,但尚未涉及其对竞赛编程工作流程、公平性规范或治理的影响。本论文通过研究利益相关者的反应并提出治理措施来填补这一空白。
解决方案
- 提出的方法: 借鉴国际象棋的治理框架,结合异常检测、专家评审、社区监督和比例制裁,以应对竞赛编程中的公平性和可信度挑战。
- 创新点:
- 提供关于LLM如何重塑参赛者、题目设计者、教练和平台管理者工作流程的实证洞察。
- 分析公平性规范以及合法辅助与作弊之间的争议界限。
- 借鉴棋类运动(如国际象棋和围棋)的治理经验,提出保障比赛完整性的治理措施。
- 程序与关键技术:
- 采访了37位利益相关者(参赛者、题目设计者、教练、平台管理者),并对207位参赛者进行了全球调查。
- 分析了Codeforces平台级数据(336场比赛,6400万次提交),以识别AI辅助工作流程的行为代理。
- 将研究结果综合为可操作的治理措施,包括基于评分的异常检测、社区驱动的监督以及透明的制裁梯度。
结果
- 具体发现:
- 参赛者在赛后复盘和日常训练中大量使用LLM,但由于严格的规则和诚信规范,在比赛期间避免使用。
- 题目设计者将LLM用于低创造性任务,如题目陈述润色、双语翻译和解题检查,但不用于创意构思。
- 教练在团队选拔中侧重筛查AI滥用行为,而平台管理者面临监控和检测方面的日益增长的压力。
- 行为代理(如Python使用比例、时间一致性)表明工具辅助工作流程的广泛转变,即使官方制裁率仍然较低。
- 相较基线的优势: 提出的治理框架通过结合自动检测、专家评审和社区监督,弥补了当前执法中的空白,确保公平性,同时最大限度地减少误报。
- 实验/评估:
- 通过采访和调查捕捉了利益相关者对工作流程、公平性和治理的观点。
- 平台级分析提供了关于制裁率和行为趋势的定量洞察。
- 治理建议借鉴了国际象棋和围棋社区的经验教训。
- 局限性与未来工作:
- 样本偏向东亚和男性参与者;未来研究应扩大人口统计学代表性。
- 对Codeforces管理者的接触有限;与其领导层的合作是优先事项。
- 社会期望偏差可能导致作弊行为的低报告;未来研究可通过社交媒体分析捕捉新兴实践。
- 行为代理是描述性趋势,而非AI使用的直接证据;需要纵向研究以区分生态系统的整体变化与AI特定影响。
总结
本文研究了LLM如何改变竞赛编程,重点关注工作流程、公平性和治理。参赛者在训练和复盘中使用LLM,但在比赛期间避免使用;题目设计者和平台管理者将其整合到低创造性任务和检测工作流程中。研究揭示了公平性规范的争议以及隐蔽的AI辅助作弊行为。作者借鉴国际象棋和围棋的经验,提出了结合异常检测、专家评审、社区监督和比例制裁的治理框架,以保障比赛的完整性。未来工作应扩大人口统计学包容性,优化检测方法,并解决AI在STEM竞赛中的不断演变角色。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 83%
交互上下文通常会增加大型语言模型中的谄媚行为
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
以人类为中心的高等教育决策算法回顾
CHI '23· AI 辅助决策与自动化系统 +2
- 71%
两个人的头脑是否比一个人在AI辅助决策中更好?比较群体和个人在人类-AI协作再犯风险评估中的行为和表现
CHI '23· 大语言模型(LLM)的人机协作 +2
- 71%
以人为本的人工智能是什么意思?研究领域的地图
CHI '23· 大语言模型(LLM)的人机协作 +2
- 71%
Stack Overflow 过时了吗?对 ChatGPT 回答 Stack Overflow 问题特征的经验研究
CHI '24· 大语言模型(LLM)的人机协作 +2
- 71%
理解配置AI在用户体验工作实践中的非使用情况的社会技术因素
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
当人工智能提供建议:评估人工智能与人类对在线幸福咨询的响应
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
理解多智能体集体中的遵从与转化动态
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
探究时间约束下LLM使用对批判性思维的影响:访问时机与时间可用性
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
迈向课程特定人工智能导师的可扩展与负责任整合:教师在校园级平台的体验研究
CHI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791410
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、AI 伦理、公平与问责
work
职业/产业
大学教授与研究人员、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文