科学家如何使用大型语言模型进行编程
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作大学教授与研究人员软件工程师与开发者数据科学家与分析师
研究背景与问题
- 发现问题: 科学研究愈发依赖编程,但许多科学家缺乏正式编程培训,代码质量控制参差不齐,尤其是在软件开发过程中常见的测试实践方面。这种现象可能会导致不可预见的编程错误,从而危及科学结论的可信性。同时,Code LLM(基于大规模语言模型的代码生成工具)在程序开发中的应用逐渐推广,但它的可靠性和科学影响尚未完全被评估。
- 重要性: 科学研究依赖于高质量代码,错误可能导致数据分析和结果的偏差。例如,本研究列举了一些因代码错误撤回的研究论文。随着Code LLM使用的普及,其生成代码相关的不确定性可能影响实验设计参数甚至科学分析本身的有效性。
- 动机与相关工作: 虽然Code LLM对编程效率提升和低经验程序员的帮助引起了注意,但它也存在输出代码需要验证的问题。已有研究表明,不管用户是学生还是专业程序员,普遍存在验证生成代码的难度,这尤其是在科学编程背景下需要进一步验证和补充研究。
解决方案
- 研究方法:
- 通过一项针对199名科学程序员的调查,探讨他们使用Code LLM的行为模式与工具偏好。
- 对14位科学研究人员进行深度访谈,进一步了解他们使用Code LLM的动机、验证策略以及潜在的代码生成问题。
- 收集用户与Code LLM的交互日志,分析真实使用场景下的行为和问题。
- 研究创新: 本研究结合调研与访谈,从科学编程角度系统化研究了Code LLM的使用现状及验证方法,揭示了ChatGPT与GitHub Copilot等不同接口在行为与效果上的显著差异。
- 具体实施:
- 用户调查: 描绘不同科研领域中科学家如何使用Code LLM工具。重点分析了工具选择(Chat vs. Copilot)、编程语言习惯与工具使用频率的关系。
- 访谈分析: 收集使用案例,重点分析Code LLM被用作信息检索工具的场景,并记录验证代码正确性的策略。
- 日志分析: 回溯用户的生成代码交互,评估潜在问题并与用户行为进行对照。
研究成果
- 具体成果:
- 发现科学家主要使用ChatGPT等基于浏览器的交互工具,而非IDE内嵌的Copilot工具。这一趋势在生命科学领域尤为明显,而在计算机科学与工程领域中,Copilot的使用率较高。
- 科学家使用Code LLM主要是为了获取信息,例如理解不熟悉的库和语言文档,其行为更多替代了Google搜索和官方文档的查阅。
- 验证代码的方法主要依赖运行代码检查结果(“目测”)或手动逐行阅读,但这些方法效率受限且容易遗漏错误。
- 用户日志显示,一些Code LLM生成的逻辑错误未被用户发现。例如,参数设置错误或关键代码段被隐性修改却未被察觉。
- 与现有解决方案的对比:
- 本研究突出强调了科学编程领域对Code LLM验证策略的不足,揭示了一些更易误用且潜在影响更大的用例,这些在更广泛的程序员群体中未有足够关注。
- 提出“科学家用户群”需要独立看待,因其编码目标主要为科研需求,而非常规商业或工程软件开发。
- 实验评估:
- 数据显示科学领域的多语言编程情况普遍存在,由此增加了科学家对Code LLM的依赖,特别是在跨领域协作场景。
- 缺乏深入的测试与验证文化推动了研究人员将信赖转移到生成工具,但这种信赖的不完全理性可能带来严重的科学风险。
- 局限性与未来方向:
- 局限性:
- 样本集中在美国一所顶尖大学,可能无法完全代表全球科学家群体。
- 数据基于自我报告,部分偏差可能存在。
- 仅调查个别工具(如ChatGPT和GitHub Copilot),未涵盖全部可用Code LLM。
- 未来方向:
- 优化Code LLM在IDE中的交互以减少用户在复杂输出代码验证时的认知负担。
- 针对科学编程的需求设计特化工具,例如更透明的代码生成反馈、自动参数敏感性分析等。
- 探索如何通过培训和工具设计减少科学家对生成代码的过度信赖,推动代码测试文化的建立。
- 局限性:
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 科学家如何使用Code LLMs(基于大型语言模型的代码生成工具)?分类: LLM代码生成与编程助手同类问题arrow_forward
- 科学家在验证Code LLM生成代码时采用哪些策略?这些策略是否有效?分类: LLM代码生成与编程助手同类问题arrow_forward
- 科学程序员的行为和目标与传统程序员相比有哪些显著不同?分类: LLM代码生成与编程助手同类问题arrow_forward
lightbulb
现实痛点
1- 科学家可能因编程错误导致实验分析失误,影响科研结论的可信性。分类: LLM代码生成与编程助手同类问题arrow_forward
- 80%
幻灯片4N:通过人与AI协作从计算笔记本创建演示文稿
CHI '23· 生成式AI(文本、图像、音乐、视频) +1
- 80%
破解编码:创意编程教育中与AI共编程
C&C '22· 生成式AI(文本、图像、音乐、视频) +1
- 67%
InterWeave:在上下文中呈现搜索建议以支持信息搜索与综合
UIST '22· 大语言模型(LLM)的人机协作 +1
- 67%
Flowco:通过数据流图和大型语言模型实现可靠端到端数据分析的混合主动式创作系统
UIST '25· 生成式AI(文本、图像、音乐、视频) +2
- 60%
携手更好?AI辅助代码翻译评估研究
IUI '22· 生成式AI(文本、图像、音乐、视频) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713668
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
1 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
大学教授与研究人员、软件工程师与开发者、数据科学家与分析师
article
内容状态
已索引正文
hub
相关论文
5 篇相关论文