当帮助变成伤害:AI编码助手的验证负荷与疲劳

荣誉提名
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统可解释人工智能(XAI)自动机器学习(AutoML)界面软件工程师与开发者AI/ML 研究员与工程师HCI 研究员

文献标题

When Help Hurts: Verification Load and Fatigue with AI Coding Assistants

出版信息

  • 主题领域: 人机交互在AI辅助编程中的应用。
  • 关键词: AI代码助手、验证负担、认知负担、交互设计、编程界面、信任校准、疲劳、可用性、自适应编排、软件开发。

背景与问题

  • 问题/挑战: 尽管AI代码助手提高了生产力,开发者却面临着显著的验证负担,需要检查和纠正AI生成的代码。目前的研究通常将界面设计与模型能力混为一谈,缺乏跨模式验证指标,也未明确交互风格的优势与不足。
  • 重要性: 理解并减轻验证负担对于提高开发者生产力、减少疲劳以及确保AI辅助代码的正确性和安全性至关重要。
  • 动机与相关工作: 先前研究强调了AI助手带来的速度提升,但报告了混合的正确性结果以及高昂的验证成本。关于认知负担和信任校准的研究表明,糟糕的界面设计可能加剧验证负担,但评估通常未能将界面效果与后端模型能力分离开来。

解决方案

  • 提出的方法: 通过对三种交互模式(内联建议、基于聊天的交互、结构化提示)进行对比研究,同时保持LLM后端不变。引入一种与模式无关的验证负担指数来量化过程成本。
  • 创新点:
    1. 后端一致性下的界面归因: 通过在各模式中使用固定的LLM后端,分离界面效果。
    2. 验证负担综合指标: 开发一个行为指数,捕捉编译/测试失败、首次编译时间、代码变动、暂停以及上下文切换。
    3. 复杂性阈值与专业指导: 确定任务复杂性阈值,分析模式优势,并提供针对专业水平的推荐。
    4. 设计与评估指导: 提出自适应模式编排、按需透明性以及验证感知的包装设计。
  • 过程与关键技术:
    • 进行了一项混合方法研究,包含60名参与者(36名使用AI辅助,24名为无AI控制组)。
    • 任务涉及具有控制复杂度的现实Python编程挑战。
    • 测量工作负担、完成时间、正确性、压力和疲劳,同时记录行为日志。
    • 应用线性混合效应模型、Johnson-Neyman分析用于复杂性阈值,以及验证负担效应的中介分析。

结果

  • 具体发现:
    • AI辅助相比无AI组减少了18.2 TLX点的工作负担,提高了正确性(OR = 1.71),任务时间缩短了22%。
    • 内联模式在简单任务中最快且负担最低;聊天模式在高复杂性任务中提高了正确性且无时间惩罚;结构化模式在中等复杂性任务中对新手有帮助。
    • 验证负担在所有任务中增加了疲劳和压力,部分中介了这些效应(疲劳26%,压力24%)。
  • 相较基线的优势:
    • AI在工作负担、时间和正确性方面优于无AI控制组。
    • 聊天模式在复杂任务中正确性优于内联模式(超出复杂性z ≈ +0.41)。
    • 结构化模式为新手减少了模糊性,在中等复杂性任务中提高了正确性。
  • 实验/评估:
    • AI模式采用平衡的被试内设计;AI与无AI采用被试间设计。
    • 任务包括解析、调试以及REST客户端实现,使用控制的参考标准。
    • 指标包括TLX工作负担、任务时间、正确性(通过的单元测试)以及验证负担综合指数。
  • 局限性与未来工作:
    • 研究集中于Python任务,且仅限单次实验;尚未测试对其他语言、框架或长期使用的泛化性。
    • 排除基于代码库或工具增强的后端以分离界面效果。
    • 未来工作应探索长期采用、更丰富的集成以及团队层面的动态。

总结

本研究表明,在AI辅助编程中,界面设计显著影响生产力与验证负担之间的权衡。内联建议模式适合简单任务,聊天模式在高复杂性任务中表现优异,结构化提示模式在中等复杂性任务中支持新手。一种与模式无关的验证负担指数量化了检查AI输出的过程成本,并部分解释了重复使用下疲劳和压力的增加。这些发现强调了自适应模式编排、按需透明性以及验证感知包装设计在优化AI代码助手中的重要性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223408/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791176
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、可解释人工智能(XAI)、自动机器学习(AutoML)界面
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文