辅助还是干扰?探讨和评估主动AI编程支持的设计和权衡
作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统原型设计与用户测试软件工程师与开发者UI/UX 设计师AI/ML 研究员与工程师
研究背景与问题
-
发现的问题或挑战:
- 当前LLM(大型语言模型)驱动的编程工具主要依赖用户发起交互(即“用户驱动”),需要用户主动提供输入以获得帮助,这增加了指导成本(如提示工程和评估AI建议的内容)。
- 现有的主动AI编程支持(如GitHub Copilot的自动补全功能)无法准确预测用户的意图,生成的代码常需用户大量验证,可能导致低效或干扰。
- 主动AI可能因过度自动化而引发安全和可控性问题,尤其是在没有清晰用户控制的情况下。
-
重要性:
- 随着AI逐步渗透到软件开发的各个方面,理解主动AI对开发人员工作流程的影响是设计未来编程工具的关键因素。
- 探讨主动AI如何既能减轻用户努力,又不造成过多的工作干扰,对于使编程更高效、更可靠具有广泛意义。
-
研究动机与相关工作:
- 借助人机协作、工作流中断管理和编程求助行为模型,作者试图揭示主动AI系统的设计权衡。
- 虽然相关研究探讨了人机协作中的打断和方法透明性,但主动AI编程支持的设计还未被充分探索。
解决方案
-
方法或解决方案:
- 提出了Codellaborator系统,一个主动AI助手,通过集成优先级启发式方法(例如任务边界检测和用户隐式信号)来动态提供编程支持,还提供指代AI存在的可见信号和局部/全局范围的交互机制。
-
创新之处:
- 提炼并应用了三大设计维度:辅助时机的调整、AI代理的表示及交互内容的范围,来探索主动AI编程工具的设计空间。
- 通过可视化的AI映射与反馈(如编辑器内的虚拟光标),从社会透明性视角设计AI存在感。
- 融入了不同交互范围(局部对话和全局会话面板)来更有效地管理代码交互内容。
-
实施步骤与关键技术:
- 主动支持:在特定时机检测触发点,如用户完成代码块、运行程序、或注释时,提供上下文敏感的帮助以减少用户负担。
- AI存在:通过虚拟游标和完成进度指示等可视化手段,让用户直观地感知AI的操作和注意力焦点。
- 多层次交互范围:通过“局部对话线程”帮助用户在代码的特定位置讨论问题,同时全局会话记录则帮助用户追踪任务上下文。
- 设计了三个不同系统版本(PromptOnly、CodeGhost、Codellaborator)进行对比评估,以分析主动性与用户体验的关系。
研究成果
-
具体成果:
- Codellaborator显著改善了主动干预引起的工作流中断问题,增强了用户对AI行为和流程的认知,减少了用户表达意图的时间。
- 在任务完成效率上,主动AI系统(CodeGhost和Codellaborator)优于仅用户驱动的PromptOnly版本。
-
优势比较:
- 与现有解决方案的优势:
- 主动AI减少了提示表达和意图阐明的成本,提高了用户与AI交互的效率。
- 通过AI代理的可视化存在(如光标和任务分类),使人机协作更接近真实的“编程伙伴”关系,而非简单的工具。
- 跨研究条件的对比:
- Codellaborator比CodeGhost进一步减少了用户察觉AI操作的混乱感和对用户的干扰。
- 与现有解决方案的优势:
-
实验和评估结果:
- 在57%的主动触发点中,用户积极参与并接受了AI的建议。
- CodeGhost条件下的中断频率高于Codellaborator,后者凭借增加AI存在透明性减少了用户反感。
- 用户对AI的信任和控制感因条件不同而变化,用户在设计与调试阶段对主动AI有更高接受度,在实现阶段则倾向于手动控制。
-
局限性与未来方向:
- 局限性:
- 系统仅针对Python单文件任务,尚未支持大型多文件规模的现实工程场景。
- 主动AI的干预触发仍依赖简单的启发式规则,部分触发点(如用户停滞时的干预)未能有效减少用户认知负担。
- 实验环境的短时交互未能体现AI支持对长期代码维护或团队开发的全貌影响。
- 未来方向:
- 开发更灵活适应用户偏好的个性化AI,动态调整工作流中任务阶段的主动干预程度。
- 在多语言、多文件的复杂软件开发场景中,研究主动AI引导设计流程和代码理解的可能性。
- 解决用户对“代码所有权”和“代码可维护性(如AI生成代码的透明度)”的核心担忧。
- 局限性:
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 什么设计策略可以平衡主动型AI编程支持的高效性和用户的工作流中断?分类: 算法厌恶、用户控制与信任校准同类问题arrow_forward
- 如何通过可视化和多层次交互技术提升用户对主动型AI的信任和控制感?分类: 算法厌恶、用户控制与信任校准同类问题arrow_forward
- 与传统用户驱动型方法相比,主动型AI编程助手对任务完成效率和用户体验的影响是什么?分类: 算法厌恶、用户控制与信任校准同类问题arrow_forward
lightbulb
现实痛点
1- 开发者需要耗费大量心力来提示和验证AI代码建议,降低编程效率。分类: 算法厌恶、用户控制与信任校准同类问题arrow_forward
- 100%
PointAloud:AI支持的指针中心发声计算交互套件
CHI '26· 大语言模型(LLM)的人机协作 +2
- 86%
“让我来帮忙”:人与网络代理协作中用户干预的实证研究
CHI '26· 大语言模型(LLM)的人机协作 +3
- 83%
"如果机器和我一样好,那我还有什么用?" – 使用ChatGPT如何改变年轻专业人士对生产力和成就的看法
CHI '24· 大语言模型(LLM)的人机协作 +1
- 83%
「这对我也会有效」:在线社区如何影响软件开发人员对AI驱动的代码生成工具的信任
IUI '25· 大语言模型(LLM)的人机协作 +1
- 83%
基于 Ply 的生成式触发-动作编程
UIST '25· 大语言模型(LLM)的人机协作 +1
- 75%
访谈驱动的生成代理用于产品发现:一项验证研究
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
即时目标:一种用于专业人工智能交互的通用方法
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
ImpReSS:面向对话支持智能体的轻量级隐式推荐系统设计与评估
IUI '26· 大语言模型(LLM)的人机协作 +4
- 71%
基于模型的强化学习适应用户界面
CHI '21· 大语言模型(LLM)的人机协作 +2
- 71%
GenieWizard:使用大型语言模型进行多模态应用程序功能发现
CHI '25· 全身交互与体感输入 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713357
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、原型设计与用户测试
work
职业/产业
软件工程师与开发者、UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文