居于循环之中:面向提示的快速运行时反馈

大语言模型(LLM)的人机协作AI 辅助决策与自动化系统用户研究方法(访谈、调查、观察)原型设计与用户测试软件工程师与开发者AI/ML 研究员与工程师HCI 研究员

文献标题

Live in the Loop: Rapid Run-time Feedback for Prompts

出版信息

  • 主题领域: 基于人工智能的编程辅助工具与实时反馈机制。
  • 关键词: LLMs, 实时编程, 运行时反馈, 代码生成, 探索性编程, 微版本管理, 提示优化, 用户研究, AI助手, IDE扩展。

背景与问题

  • 问题/挑战: 当前的AI代码助手(如GitHub Copilot)缺乏提供生成代码实时运行反馈的机制,导致在优化提示和验证代码建议时效率低下。
  • 重要性: 解决AI辅助编程中的“设想鸿沟”和“评估鸿沟”问题,可以提高代码生成的准确性和意图性,减少错误和迭代次数。
  • 动机与相关工作: 之前关于实时编程环境和工具(如LEAP)的研究表明,实时反馈对于评估代码变更的益处。然而,这些系统主要关注代码层面的交互,而非运行时结果,导致在提示优化和多方案探索方面存在空白。

解决方案

  • 提出的方法: ReFiQ(“Result-first Queries”),一种优先展示运行时结果的实时编程工具,并为单一提示显示多个结果。
  • 创新点:
    1. 在代码建议之前展示运行时值。
    2. 支持同时探索提示的多种解释。
    3. 集成实时编程机制,例如探针,用于将交互锚定在运行时数据层面。
    4. 通过即时反馈鼓励有意的提示优化。
  • 流程与关键技术:
    • 用户通过探针查看实时运行时值。
    • 提示直接参考运行时数据进行发布。
    • 自动生成并执行多个代码建议,优先展示其运行时结果。
    • 用户根据运行时效果选择所需行为,并逐步揭示代码变更。
    • 系统支持微版本管理以跟踪和回滚变更。

结果

  • 具体发现:
    • 与GitHub Copilot相比,ReFiQ减少了49%的手动代码迭代。
    • 参与者在ReFiQ中发布的提示增加了9%,并在优化提示上花费了56%的额外时间。
    • 使用ReFiQ创建的程序错误显著减少(p = 0.022),输出质量更高。
  • 相较基线的优势:
    • 提示优化的反馈循环更快。
    • 对生成代码的正确性和输出的信任度更高。
    • 通过多个运行时结果更好地探索解决方案空间。
  • 实验/评估:
    • 采用8名参与者的探索性用户研究,使用组内设计。
    • 任务: OCR预处理和地形分割。
    • 评估指标: 任务完成情况、输出质量、交互日志、问卷调查和主题分析。
  • 局限性与未来工作:
    • 在图像处理等视觉领域以外的有效性有限。
    • 样本量较小(n=8),影响统计效力。
    • 缺乏提示的撤销/重做功能以及跨迭代的回溯支持。
    • 未来工作可以探索将提示作为一级编程工件进行集成,并增强代码建议的解释功能。

总结

ReFiQ引入了一种以结果为优先的AI辅助编程方法,使用户能够通过即时运行时反馈优化提示并验证代码建议。该工具相比GitHub Copilot显著减少了手动迭代次数,提高了输出质量,并改善了解决方案空间的探索。虽然研究揭示了代码理解和泛化方面的权衡,ReFiQ的设计通过优先运行时结果和支持有意决策推动了实时编程工作流的发展。未来工作可以解决回溯方面的局限性,并扩展其在非视觉领域的适用性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223496/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791731
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文