行间阅读:建模AI辅助编程中的用户行为和成本

荣誉提名
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统推荐系统用户体验软件工程师与开发者AI/ML 研究员与工程师

文献标题

Reading Between the Lines: Modeling User Behavior and Costs in AI-Assisted Programming

文献信息

  • 主题领域: 人机交互、人工智能辅助编程
  • 关键词: AI辅助编程, Copilot, 用户状态模型, 编程行为分析, 编程效率, 人机协作, 代码生成模型, 测试评估, 接口设计, 遥测数据

研究背景与问题

  • 问题与挑战:

    • 代码推荐系统(如 Copilot 和 CodeWhisperer)能够提高程序员的生产力,但仍需了解用户与这些系统之间的交互方式,以及如何优化。
    • 当前度量标准(如建议接受率、减少输入的字符数等)无法全面捕捉用户与推荐系统交互的复杂性。
    • 缺乏对程序员活动详细分类的工具,使得难以揭示潜在效率损失和时间成本。
  • 必要性:

    • 对于代码推荐系统优化的需求不仅关乎效率,还关乎用户体验和生产力的提升。
    • 深入理解用户行为可以帮助设计更高效的接口和模型,从而更好地服务开发者。
  • 研究动机与相关工作:

    • 人工智能生成代码的模型(如 GPT 和 Codex)的潜力表明,这些系统可能改变软件开发的模式。
    • 先前研究表明程序员感受到生产力的提升,但同时指出需要更多细粒度的数据,而不仅仅是基于功能完成时间的评估。
    • 本研究从 CodeRec(包括 Copilot 在内的代码推荐系统)交互行为的系统性分析入手,提出新的活动分类体系 CUPS(CodeRec User Programming States)。

解决方案

  • 方法:

    • 作者提出了 CUPS(CodeRec 用户编程状态)的分类体系,该体系将程序员与代码推荐系统交互的行为分为12类状态。
    • 使用实验设计,收集相关的遥测数据、屏幕录像及用户自主标签,分析程序员的编程模式。
    • 提供设计优化建议以减少交互中的低效行为。
  • 创新点:

    • 提出一个新的、多级别的用户行为分类体系(CUPS),既能捕捉细粒度的交互行为,又能提供总体用户活动的有意义概括。
    • 结合用户标签和遥测数据实现在编程环境中的行为分析。
    • 可视化用户行为的时间轴与状态转移,为识别效率损失提供直观洞察。
  • 实施步骤与技术:

    1. 开发 CUPS 标签工具,使用户能够回顾编程会话并标注具体状态。
    2. 设计实验收集21名程序员在 Copilot 环境下完成任务的数据,包括视频回放、自主标签和遥测记录。
    3. 分析数据以生成按状态分类的时间轴和状态转移图,揭示行为模式。
    4. 提出基于观察结果的界面设计与度量优化建议,如引入状态预测与个性化交互优化。

研究成果

  • 具体成果:

    • 提出了 CUPS 分类体系,包含12个用户状态(如“验证推荐代码”、“编写新功能”)。
    • 从收集的3137个标签样本中,分析了用户在各状态中花费的时间占比,揭示了 Copilot 使用中的行为模式。
    • 指出 Copilot 相关任务(如验证建议、处理延迟等)占编程时间的一半以上。
    • 给出了一些设计建议,如减少提示生成时间,改进界面以适应用户当前状态。
  • 与现有解决方案的比较与优势:

    • 相较于传统的任务完成时间测量,本研究揭示了具体交互成本,如验证与编辑推荐代码需要更多时间。
    • 作者针对 Copilot引入的行为进行了精细划分,能够更明确地定位效率低下的环节。
    • 提出了新指标,如调整接受率和核验时间,包括接受建议后继续验证和编辑的时间。
  • 实验与评估结果:

    • Copilot 推荐代码的验证平均耗时显著长于仅仅观察推荐时间(多出约5倍)。
    • 程序员在使用 Copilot 时更多地处于与推荐系统相关的状态(占编程时间51.5%)。
    • 用户行为模式显示,当建议质量不足时,编程任务中的延迟占比显著增加。
  • 局限性与未来方向:

    • 局限性包括实验任务场景有限,未覆盖所有编程语言以及远期交互成本(如代码安全问题)。
    • 未来工作可能包括:开发更复杂的状态预测模型;研究不同版本 Copilot 的影响;应用 CUPS 方法于其它领域的 AI辅助工具(如写作或法律助手);评估对生产力的长期影响。

总结

本研究系统性地分析了程序员使用代码推荐系统的行为模式,提出了适用于交互行为分类的 CUPS 系统,并利用实证数据生成了详尽的分析,用于优化 AI 辅助编程的设计与度量标准。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/146797/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3641936
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
荣誉提名
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、推荐系统用户体验
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文