居于循环之中:面向提示的快速运行时反馈
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统用户研究方法(访谈、调查、观察)原型设计与用户测试软件工程师与开发者AI/ML 研究员与工程师HCI 研究员
文献标题
Live in the Loop: Rapid Run-time Feedback for Prompts
出版信息
- 主题领域: 基于人工智能的编程辅助工具与实时反馈机制。
- 关键词: LLMs, 实时编程, 运行时反馈, 代码生成, 探索性编程, 微版本管理, 提示优化, 用户研究, AI助手, IDE扩展。
背景与问题
- 问题/挑战: 当前的AI代码助手(如GitHub Copilot)缺乏提供生成代码实时运行反馈的机制,导致在优化提示和验证代码建议时效率低下。
- 重要性: 解决AI辅助编程中的“设想鸿沟”和“评估鸿沟”问题,可以提高代码生成的准确性和意图性,减少错误和迭代次数。
- 动机与相关工作: 之前关于实时编程环境和工具(如LEAP)的研究表明,实时反馈对于评估代码变更的益处。然而,这些系统主要关注代码层面的交互,而非运行时结果,导致在提示优化和多方案探索方面存在空白。
解决方案
- 提出的方法: ReFiQ(“Result-first Queries”),一种优先展示运行时结果的实时编程工具,并为单一提示显示多个结果。
- 创新点:
- 在代码建议之前展示运行时值。
- 支持同时探索提示的多种解释。
- 集成实时编程机制,例如探针,用于将交互锚定在运行时数据层面。
- 通过即时反馈鼓励有意的提示优化。
- 流程与关键技术:
- 用户通过探针查看实时运行时值。
- 提示直接参考运行时数据进行发布。
- 自动生成并执行多个代码建议,优先展示其运行时结果。
- 用户根据运行时效果选择所需行为,并逐步揭示代码变更。
- 系统支持微版本管理以跟踪和回滚变更。
结果
- 具体发现:
- 与GitHub Copilot相比,ReFiQ减少了49%的手动代码迭代。
- 参与者在ReFiQ中发布的提示增加了9%,并在优化提示上花费了56%的额外时间。
- 使用ReFiQ创建的程序错误显著减少(p = 0.022),输出质量更高。
- 相较基线的优势:
- 提示优化的反馈循环更快。
- 对生成代码的正确性和输出的信任度更高。
- 通过多个运行时结果更好地探索解决方案空间。
- 实验/评估:
- 采用8名参与者的探索性用户研究,使用组内设计。
- 任务: OCR预处理和地形分割。
- 评估指标: 任务完成情况、输出质量、交互日志、问卷调查和主题分析。
- 局限性与未来工作:
- 在图像处理等视觉领域以外的有效性有限。
- 样本量较小(n=8),影响统计效力。
- 缺乏提示的撤销/重做功能以及跨迭代的回溯支持。
- 未来工作可以探索将提示作为一级编程工件进行集成,并增强代码建议的解释功能。
总结
ReFiQ引入了一种以结果为优先的AI辅助编程方法,使用户能够通过即时运行时反馈优化提示并验证代码建议。该工具相比GitHub Copilot显著减少了手动迭代次数,提高了输出质量,并改善了解决方案空间的探索。虽然研究揭示了代码理解和泛化方面的权衡,ReFiQ的设计通过优先运行时结果和支持有意决策推动了实时编程工作流的发展。未来工作可以解决回溯方面的局限性,并扩展其在非视觉领域的适用性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 100%
DALL:基于数据编程和大型语言模型增强的主动学习进行数据标注
CHI '26· 大语言模型(LLM)的人机协作 +3
- 100%
数据与提示词协同演化:通过扩展测试集优化大语言模型行为
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
访谈驱动的生成代理用于产品发现:一项验证研究
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
"我们是否要深入探讨?":为异步在线讨论中推进知识共建设计并评估LLM智能体策略
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
即时目标:一种用于专业人工智能交互的通用方法
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
TurnStyle:一个分析人类对话行为以预测LLM辅助任务成功的框架
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
Perspectra:选择专家增强多智能体研究创意生成中的批判性思维
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
“让我来帮忙”:人与网络代理协作中用户干预的实证研究
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
设计LLM的分阶段评估工作流程:整合领域专家、普通用户和模型生成的评估标准
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
隐形导师:从屏幕录制推断用户操作以推荐更好的工作流程
CHI '26· 大语言模型(LLM)的人机协作 +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791731
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文