携手更好?AI辅助代码翻译评估研究
作者
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作软件工程师与开发者
文献标题
Better Together? An Evaluation of AI-Supported Code Translation
文献信息
- 主题领域: 人机协同、代码翻译、生成式 AI 系统的设计与应用
- 关键词: 代码翻译, 人机协同创造, 生成式 AI, 不完美 AI, 软件工程
研究背景与问题
-
发现的问题:
- 最先进的生成式 AI 模型(如 TransCoder 和 Codex)在代码生成和翻译任务中存在错误或不完整的输出,正确率在 30%-70% 不等。
- 软件工程师是否能够通过与不完美的生成式 AI 模型合作提高生产力尚未被充分探索。
-
研究的重要性: 借助生成式 AI 改善代码质量和工程效率有着巨大的潜力。然而,这需要明确如何设计人机交互以最大化协同效果。同时,理解生成式 AI 在有缺陷输出下的学习与工作过程对未来更好地设计 AI 支持界面具有理论与实际意义。
-
研究动机与相关工作:
- 尽管生成式 AI 在代码翻译和补全方面的功能取得了一定成功,但关于这些工具是否对软件工程师的效率与结果有实际提升,研究并不充分。
- 本研究通过实验证明生成式 AI 在代码翻译任务中的可用性与效率提升,并对其副作用及用户体验展开分析。
解决方案
-
提出的方法: 作者设计了一项对比实验,研究软件工程师是否能通过生成式 AI 模型的支持在 Java 到 Python 代码翻译任务中实现更高效的输出。
-
创新之处:
- 考察了生成式 AI 输出的数量和质量对协同性能的影响,明确了多个翻译选项是否有助于用户决策。
- 在限制时间条件下,验证 AI 翻译是否能从代码“生产任务”转变为“代码审查任务”。
-
实施步骤与关键技术:
- 使用 TransCoder 模型生成 Java 到 Python 的数据结构(Trie 和 Priority Queue)的代码翻译,分别设置“较差”与“较好”输出质量。
- 32 位专业软件工程师参与实验,通过随机配对完成两种条件下的任务(无 AI 支持 vs 有 AI 支持)。
- 对输出代码进行质量评估,量化错误率、正确率,以及超过 1700 项编程错误的分类分析(如翻译错误、语言错误、文档遗漏等)。
研究成果
-
具体成果:
- 翻译性能提升:
- 带有 AI 支持的代码错误率显著减少(从 63% 降至 31%)。
- 正确翻译的函数比例从 34.1% 提升至 50.9%。
- 用户行为与习惯:
- 用户将任务从代码“生产”转变为代码“审查”,减少了机械式编程的工作量。
- 超过半数用户表示 AI 翻译帮助节省时间,并且有助于学习新的编程模式。
- 翻译选项影响:
- 提供 5 个翻译版本(相比提供 1 个版本)会增加工作负载与用户的认知压力。
- “质量更好”的翻译版本对错误减少有直接帮助。
- 翻译性能提升:
-
与现有研究的比较: 本研究进一步支持了人机协作在复杂任务中可能产生的优势,并挑战了认为“AI 必须完美才有用”的观点。
-
实验局限性与未来方向:
- 本研究主要关注“代码翻译”任务,未来可扩展至如代码生成、文档生成等更多软件工程场景。
- 交互设计方向: 开发更智能的用户界面,例如:
- 高亮显示多个翻译的差异。
- 实现类似“代码教练”或“智能审查助手”的功能。
- XAI(可解释性 AI)结合: 为生成式 AI 输出赋予解释性功能,帮助开发者更直观地理解和校验机器输出。
附加讨论
- 社会影响:
- 积极:代码生成 AI 工具有助于降低职业编程的门槛,实现软件工程的民主化。
- 消极:过度自动化可能替代人工劳动力,需通过设计人机协同系统以减轻风险。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 软件工程师在代码翻译任务中,使用生成式AI是否能够提高效率和产出质量?分类: AI代码翻译与错误修复支持同类问题arrow_forward
- 生成式AI的输出数量和质量如何影响人与AI协作的效果?分类: AI代码翻译与错误修复支持同类问题arrow_forward
- 在时间受限的条件下,AI辅助的翻译是否能将任务焦点从“代码生产”转移至“代码审查”上?分类: AI代码翻译与错误修复支持同类问题arrow_forward
lightbulb
现实痛点
1- 软件工程师面对AI生成的代码翻译错误,工作效率和产出质量难以保证。分类: AI代码翻译与错误修复支持同类问题arrow_forward
- 75%
使用生成语言模型发现自然语言编程的语法和策略
CHI '22· 生成式AI(文本、图像、音乐、视频) +1
- 75%
幻灯片4N:通过人与AI协作从计算笔记本创建演示文稿
CHI '23· 生成式AI(文本、图像、音乐、视频) +1
- 75%
《它想让我怎么说》:弥合最终用户程序员与代码生成大型语言模型之间的抽象差距
CHI '23· 生成式AI(文本、图像、音乐、视频) +1
- 75%
生成性和可塑性用户界面与生成性和演进的任务驱动数据模型
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 75%
生成式AI对批判性思维的影响:来自知识工作者调查的自我报告的认知努力减少和信心效应
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 75%
GeneyMAP: 探索GenAI促进用户体验设计中用户旅程映射的潜力
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 75%
D-Twins:专为实时无聊干预设计的数字双胞胎
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 75%
破解编码:创意编程教育中与AI共编程
C&C '22· 生成式AI(文本、图像、音乐、视频) +1
- 75%
接受、拒绝还是修正:人机协作中生产力与信任的度量
IUI '24· 生成式AI(文本、图像、音乐、视频) +1
- 67%
PANDALens: 在旅行过程中面向OHMD的AI辅助上下文写作
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3490099.3511157
一眼看懂
fact_check论文快照
dataset
来源
IUI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
软件工程师与开发者
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文