与我共编还是为我编程?AI 自动化程度提升如何改变开发者工作流
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统可解释人工智能(XAI)软件工程师与开发者AI/ML 研究员与工程师HCI 研究员
文献标题
Code with Me or for Me? How Increasing AI Automation Transforms Developer Workflows
出版信息
- 主题领域: 人工智能自动化对软件开发工作流程的影响
- 关键词: AI 编码助手、协同助手、编码代理、开发者生产力、用户体验、软件工作流程、GitHub Copilot、OpenHands、人机交互、大型语言模型(LLMs)
背景与问题
- 问题/挑战: 当前对编码代理的评估依赖于静态基准测试,无法捕捉真实开发者交互的情况。关于编码代理与协同助手在生产力和用户体验方面的比较研究仍然有限。
- 重要性: 理解日益自主的人工智能工具对开发者工作流程的影响,对于改进工作流程和确保这些技术的有效采用至关重要。
- 动机与相关工作: 先前的研究广泛分析了协同助手(如 GitHub Copilot),并显示其对生产力的积极影响。然而,编码代理由于其更高的自主性,在真实场景中的研究仍然不足。本文通过对协同助手和编码代理的对比研究填补了这一空白。
解决方案
- 提出的方法: 通过对 GitHub Copilot(协同助手)和 OpenHands(编码代理)的对比用户研究,评估其对开发者生产力、用户体验和交互模式的影响。
- 创新点:
- 首次在真实编码任务中对协同助手和编码代理进行直接对比的控制研究。
- 量化两种工具在生产力提升和用户体验方面的差异。
- 确定改进代理工作流程的设计需求。
- 研究流程与关键技术:
- 招募了 20 名有 GitHub Copilot 使用经验但无编码代理经验的参与者。
- 任务包括在 Python 仓库中创建程序、添加功能和修复错误。
- 采用参与者内设计,任务顺序随机分配,参与者分别与两种工具交互。
- 收集的数据包括任务正确率、用户努力(耗时)、Likert 量表调查结果和定性反馈。
结果
- 具体发现:
- 编码代理使任务正确率提高了 35%(代理为 60%,协同助手为 25%,p=0.02)。
- 使用编码代理的用户努力减半(代理为 12.5 分钟,协同助手为 25.1 分钟,p=0.01)。
- 编码代理在自动化环境设置和调试任务方面表现尤为出色。
- 相较基线的优势:
- 编码代理在任务完成率和降低认知负担方面优于协同助手。
- 参与者表示,使用编码代理完成了协同助手无法实现的新任务。
- 实验/评估:
- 评估指标:任务正确率、耗时、Likert 量表评分、定性反馈。
- 工具:GitHub Copilot 和 OpenHands。
- 任务:Python 仓库中的数据分析、功能添加和错误修复。
- 局限性与未来工作:
- 仅限于一种协同助手和一种编码代理,结果可能无法推广到其他工具。
- 参与者为编码代理的新手用户,结果可能与有经验用户不同。
- 研究时间和任务范围有限,未完全反映真实工作流程。
- 未来研究应探索代理的透明性、平衡的主动性以及多任务工作流程。
总结
本研究首次在真实软件开发任务中对 AI 协同助手(GitHub Copilot)和编码代理(OpenHands)进行了控制对比。编码代理显著提高了生产力,减少了用户努力,并实现了新任务的完成。然而,用户体验方面的挑战(如理解代理输出)仍然存在。研究结果突出了编码代理在变革开发者工作流程方面的潜力,同时指出了改进方向,包括透明性和平衡的主动性。这些见解对设计更好的软件工程及其他领域的人机交互具有广泛的适用性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 100%
看不见的破坏者:谄媚型大语言模型在问题解决任务中误导新手
CHI '26· 大语言模型(LLM)的人机协作 +2
- 100%
响应延迟和任务类型对人类-LLM 交互与感知的影响
CHI '26· 大语言模型(LLM)的人机协作 +2
- 86%
DiLLS:基于智能体行为分层摘要的LLM多智能体系统交互式诊断
CHI '26· 大语言模型(LLM)的人机协作 +3
- 86%
当帮助变成伤害:AI编码助手的验证负荷与疲劳
CHI '26· 大语言模型(LLM)的人机协作 +3
- 83%
胜任但僵化:识别赋予AI平等参与群体决策能力的差距
CHI '23· 大语言模型(LLM)的人机协作 +1
- 83%
为什么约翰尼不能提示:非AI专家如何尝试(并失败)设计LLM提示
CHI '23· 大语言模型(LLM)的人机协作 +1
- 83%
《你真的确定吗?》理解人类自我信心校准在人工智能辅助决策中的影响
CHI '24· 可解释人工智能(XAI) +1
- 83%
从大规模交互痕迹中自动挖掘宏命令
CHI '24· 大语言模型(LLM)的人机协作 +1
- 83%
多智能体AI系统的交互式调试和引导
CHI '25· 大语言模型(LLM)的人机协作 +2
- 83%
哪些贡献值得认可?人类与AI共同创作中的归属感认知
CHI '25· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790850
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、可解释人工智能(XAI)
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文