当帮助变成伤害:AI编码助手的验证负荷与疲劳
荣誉提名大语言模型(LLM)的人机协作AI 辅助决策与自动化系统可解释人工智能(XAI)自动机器学习(AutoML)界面软件工程师与开发者AI/ML 研究员与工程师HCI 研究员
文献标题
When Help Hurts: Verification Load and Fatigue with AI Coding Assistants
出版信息
- 主题领域: 人机交互在AI辅助编程中的应用。
- 关键词: AI代码助手、验证负担、认知负担、交互设计、编程界面、信任校准、疲劳、可用性、自适应编排、软件开发。
背景与问题
- 问题/挑战: 尽管AI代码助手提高了生产力,开发者却面临着显著的验证负担,需要检查和纠正AI生成的代码。目前的研究通常将界面设计与模型能力混为一谈,缺乏跨模式验证指标,也未明确交互风格的优势与不足。
- 重要性: 理解并减轻验证负担对于提高开发者生产力、减少疲劳以及确保AI辅助代码的正确性和安全性至关重要。
- 动机与相关工作: 先前研究强调了AI助手带来的速度提升,但报告了混合的正确性结果以及高昂的验证成本。关于认知负担和信任校准的研究表明,糟糕的界面设计可能加剧验证负担,但评估通常未能将界面效果与后端模型能力分离开来。
解决方案
- 提出的方法: 通过对三种交互模式(内联建议、基于聊天的交互、结构化提示)进行对比研究,同时保持LLM后端不变。引入一种与模式无关的验证负担指数来量化过程成本。
- 创新点:
- 后端一致性下的界面归因: 通过在各模式中使用固定的LLM后端,分离界面效果。
- 验证负担综合指标: 开发一个行为指数,捕捉编译/测试失败、首次编译时间、代码变动、暂停以及上下文切换。
- 复杂性阈值与专业指导: 确定任务复杂性阈值,分析模式优势,并提供针对专业水平的推荐。
- 设计与评估指导: 提出自适应模式编排、按需透明性以及验证感知的包装设计。
- 过程与关键技术:
- 进行了一项混合方法研究,包含60名参与者(36名使用AI辅助,24名为无AI控制组)。
- 任务涉及具有控制复杂度的现实Python编程挑战。
- 测量工作负担、完成时间、正确性、压力和疲劳,同时记录行为日志。
- 应用线性混合效应模型、Johnson-Neyman分析用于复杂性阈值,以及验证负担效应的中介分析。
结果
- 具体发现:
- AI辅助相比无AI组减少了18.2 TLX点的工作负担,提高了正确性(OR = 1.71),任务时间缩短了22%。
- 内联模式在简单任务中最快且负担最低;聊天模式在高复杂性任务中提高了正确性且无时间惩罚;结构化模式在中等复杂性任务中对新手有帮助。
- 验证负担在所有任务中增加了疲劳和压力,部分中介了这些效应(疲劳26%,压力24%)。
- 相较基线的优势:
- AI在工作负担、时间和正确性方面优于无AI控制组。
- 聊天模式在复杂任务中正确性优于内联模式(超出复杂性z ≈ +0.41)。
- 结构化模式为新手减少了模糊性,在中等复杂性任务中提高了正确性。
- 实验/评估:
- AI模式采用平衡的被试内设计;AI与无AI采用被试间设计。
- 任务包括解析、调试以及REST客户端实现,使用控制的参考标准。
- 指标包括TLX工作负担、任务时间、正确性(通过的单元测试)以及验证负担综合指数。
- 局限性与未来工作:
- 研究集中于Python任务,且仅限单次实验;尚未测试对其他语言、框架或长期使用的泛化性。
- 排除基于代码库或工具增强的后端以分离界面效果。
- 未来工作应探索长期采用、更丰富的集成以及团队层面的动态。
总结
本研究表明,在AI辅助编程中,界面设计显著影响生产力与验证负担之间的权衡。内联建议模式适合简单任务,聊天模式在高复杂性任务中表现优异,结构化提示模式在中等复杂性任务中支持新手。一种与模式无关的验证负担指数量化了检查AI输出的过程成本,并部分解释了重复使用下疲劳和压力的增加。这些发现强调了自适应模式编排、按需透明性以及验证感知包装设计在优化AI代码助手中的重要性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 86%
看不见的破坏者:谄媚型大语言模型在问题解决任务中误导新手
CHI '26· 大语言模型(LLM)的人机协作 +2
- 86%
响应延迟和任务类型对人类-LLM 交互与感知的影响
CHI '26· 大语言模型(LLM)的人机协作 +2
- 86%
与我共编还是为我编程?AI 自动化程度提升如何改变开发者工作流
CHI '26· 大语言模型(LLM)的人机协作 +2
- 86%
用户界面的终身学习
UIST '23· 大语言模型(LLM)的人机协作 +2
- 75%
DiLLS:基于智能体行为分层摘要的LLM多智能体系统交互式诊断
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
胜任但僵化:识别赋予AI平等参与群体决策能力的差距
CHI '23· 大语言模型(LLM)的人机协作 +1
- 71%
为什么约翰尼不能提示:非AI专家如何尝试(并失败)设计LLM提示
CHI '23· 大语言模型(LLM)的人机协作 +1
- 71%
《你真的确定吗?》理解人类自我信心校准在人工智能辅助决策中的影响
CHI '24· 可解释人工智能(XAI) +1
- 71%
从大规模交互痕迹中自动挖掘宏命令
CHI '24· 大语言模型(LLM)的人机协作 +1
- 71%
多智能体AI系统的交互式调试和引导
CHI '25· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791176
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、可解释人工智能(XAI)、自动机器学习(AutoML)界面
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文