行间阅读:建模AI辅助编程中的用户行为和成本
荣誉提名大语言模型(LLM)的人机协作AI 辅助决策与自动化系统推荐系统用户体验软件工程师与开发者AI/ML 研究员与工程师
文献标题
Reading Between the Lines: Modeling User Behavior and Costs in AI-Assisted Programming
文献信息
- 主题领域: 人机交互、人工智能辅助编程
- 关键词: AI辅助编程, Copilot, 用户状态模型, 编程行为分析, 编程效率, 人机协作, 代码生成模型, 测试评估, 接口设计, 遥测数据
研究背景与问题
-
问题与挑战:
- 代码推荐系统(如 Copilot 和 CodeWhisperer)能够提高程序员的生产力,但仍需了解用户与这些系统之间的交互方式,以及如何优化。
- 当前度量标准(如建议接受率、减少输入的字符数等)无法全面捕捉用户与推荐系统交互的复杂性。
- 缺乏对程序员活动详细分类的工具,使得难以揭示潜在效率损失和时间成本。
-
必要性:
- 对于代码推荐系统优化的需求不仅关乎效率,还关乎用户体验和生产力的提升。
- 深入理解用户行为可以帮助设计更高效的接口和模型,从而更好地服务开发者。
-
研究动机与相关工作:
- 人工智能生成代码的模型(如 GPT 和 Codex)的潜力表明,这些系统可能改变软件开发的模式。
- 先前研究表明程序员感受到生产力的提升,但同时指出需要更多细粒度的数据,而不仅仅是基于功能完成时间的评估。
- 本研究从 CodeRec(包括 Copilot 在内的代码推荐系统)交互行为的系统性分析入手,提出新的活动分类体系 CUPS(CodeRec User Programming States)。
解决方案
-
方法:
- 作者提出了 CUPS(CodeRec 用户编程状态)的分类体系,该体系将程序员与代码推荐系统交互的行为分为12类状态。
- 使用实验设计,收集相关的遥测数据、屏幕录像及用户自主标签,分析程序员的编程模式。
- 提供设计优化建议以减少交互中的低效行为。
-
创新点:
- 提出一个新的、多级别的用户行为分类体系(CUPS),既能捕捉细粒度的交互行为,又能提供总体用户活动的有意义概括。
- 结合用户标签和遥测数据实现在编程环境中的行为分析。
- 可视化用户行为的时间轴与状态转移,为识别效率损失提供直观洞察。
-
实施步骤与技术:
- 开发 CUPS 标签工具,使用户能够回顾编程会话并标注具体状态。
- 设计实验收集21名程序员在 Copilot 环境下完成任务的数据,包括视频回放、自主标签和遥测记录。
- 分析数据以生成按状态分类的时间轴和状态转移图,揭示行为模式。
- 提出基于观察结果的界面设计与度量优化建议,如引入状态预测与个性化交互优化。
研究成果
-
具体成果:
- 提出了 CUPS 分类体系,包含12个用户状态(如“验证推荐代码”、“编写新功能”)。
- 从收集的3137个标签样本中,分析了用户在各状态中花费的时间占比,揭示了 Copilot 使用中的行为模式。
- 指出 Copilot 相关任务(如验证建议、处理延迟等)占编程时间的一半以上。
- 给出了一些设计建议,如减少提示生成时间,改进界面以适应用户当前状态。
-
与现有解决方案的比较与优势:
- 相较于传统的任务完成时间测量,本研究揭示了具体交互成本,如验证与编辑推荐代码需要更多时间。
- 作者针对 Copilot引入的行为进行了精细划分,能够更明确地定位效率低下的环节。
- 提出了新指标,如调整接受率和核验时间,包括接受建议后继续验证和编辑的时间。
-
实验与评估结果:
- Copilot 推荐代码的验证平均耗时显著长于仅仅观察推荐时间(多出约5倍)。
- 程序员在使用 Copilot 时更多地处于与推荐系统相关的状态(占编程时间51.5%)。
- 用户行为模式显示,当建议质量不足时,编程任务中的延迟占比显著增加。
-
局限性与未来方向:
- 局限性包括实验任务场景有限,未覆盖所有编程语言以及远期交互成本(如代码安全问题)。
- 未来工作可能包括:开发更复杂的状态预测模型;研究不同版本 Copilot 的影响;应用 CUPS 方法于其它领域的 AI辅助工具(如写作或法律助手);评估对生产力的长期影响。
总结
本研究系统性地分析了程序员使用代码推荐系统的行为模式,提出了适用于交互行为分类的 CUPS 系统,并利用实证数据生成了详尽的分析,用于优化 AI 辅助编程的设计与度量标准。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何系统分类和建模用户在代码推荐系统(如Copilot)中的编程状态?分类: 编程助手与多轮代码支持同类问题arrow_forward
- 用户在使用代码推荐系统时有哪些具体的交互效率损耗?分类: 编程助手与多轮代码支持同类问题arrow_forward
- 能否改进代码推荐系统的界面设计和交互方式以优化用户体验和生产力?分类: 编程助手与多轮代码支持同类问题arrow_forward
lightbulb
现实痛点
1- 程序员在使用代码推荐工具时,验证与编辑建议代码耗费大量时间。分类: 编程助手与多轮代码支持同类问题arrow_forward
- 80%
在人工智能中介沟通中比较句子层面的建议和消息层面的建议
CHI '23· 大语言模型(LLM)的人机协作 +1
- 80%
VAL:使用GPT对话解析进行交互式任务学习
CHI '24· 大语言模型(LLM)的人机协作 +1
- 80%
需要帮助吗?为编程设计主动型AI助手
CHI '25· 大语言模型(LLM)的人机协作 +1
- 71%
LLM驱动的GUI代理的行为结构:人类价值观与交互结果
IUI '26· 大语言模型(LLM)的人机协作 +3
- 67%
胜任但僵化:识别赋予AI平等参与群体决策能力的差距
CHI '23· 大语言模型(LLM)的人机协作 +1
- 67%
为什么约翰尼不能提示:非AI专家如何尝试(并失败)设计LLM提示
CHI '23· 大语言模型(LLM)的人机协作 +1
- 67%
从大规模交互痕迹中自动挖掘宏命令
CHI '24· 大语言模型(LLM)的人机协作 +1
- 67%
"如果机器和我一样好,那我还有什么用?" – 使用ChatGPT如何改变年轻专业人士对生产力和成就的看法
CHI '24· 大语言模型(LLM)的人机协作 +1
- 67%
多智能体AI系统的交互式调试和引导
CHI '25· 大语言模型(LLM)的人机协作 +2
- 67%
GenComUI:探索生成式视觉辅助作为支持任务导向人机通信的媒介
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3641936
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
荣誉提名
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、推荐系统用户体验
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文