RAG无延迟:使检索增强生成管道的“假设”分析成为可能

最佳论文
大语言模型(LLM)的人机协作原型设计与用户测试软件工程师与开发者AI/ML 研究员与工程师HCI 研究员

文献标题

RAG Without the Lag: Enabling 'What-If' Analysis for Retrieval-Augmented Generation Pipelines

出版信息

  • 主题领域: 面向人工智能系统的检索增强生成(RAG)管道的开发与调试。
  • 关键词: RAG管道,调试工具,检索增强生成,大型语言模型,交互界面,查询重写,检索优化,分块,迭代开发,评估框架。

背景与问题

  • 问题/挑战: RAG管道由于检索和生成组件的紧密耦合,导致错误难以隔离和优化,调试过程复杂。迭代周期较慢,因为参数的更改通常需要重新索引文档,这可能耗时数小时。
  • 重要性: RAG管道被广泛用于集成外部知识的AI助手,但其开发过程仍然充满挑战,限制了其在生产环境中的可靠性和可扩展性。
  • 动机与相关工作: 以往的研究探索了软件、机器学习和大型语言模型系统的调试界面,以及RAG管道的可视化工具。然而,现有工具无法支持检索和生成组件之间的快速实验,也无法在开发过程中进行系统化评估。

解决方案

  • 提出的方法: raggy,一个结合了可组合RAG原语的Python库与交互式调试界面的开发工具,用于实时实验和可视化。
  • 创新点:
    1. 一个低延迟的“假设分析”框架,支持动态参数调整,无需重新索引。
    2. 针对检索和大型语言模型组件的专门调试可视化,突出失败模式。
    3. 持久化测试套件功能,用于构建代表性查询并评估管道演变。
  • 流程与关键技术:
    • 开发者使用raggy原语在Python中编写RAG管道。
    • 执行时,系统启动一个交互界面,包含查询、检索器、LLM和答案组件的单元格。
    • 预计算的向量索引和程序状态检查点支持快速参数调整和管道重新执行。
    • 用户可以检查检索到的分块,编辑提示词,修改输出,并保存答案以进行系统化评估。

结果

  • 具体发现:
    • 平均而言,参与者所做的71.3%的检索参数更改在传统工作流中需要耗时的重新索引。
    • 参与者高度评价raggy减少迭代时间的能力,检索调整从数小时缩短到几秒。
  • 相较基线的优势: raggy消除了重新索引的延迟,并提供了现有RAG开发工具所不具备的交互式调试功能。
  • 实验/评估:
    • 对12位经验丰富的RAG开发者进行用户研究,任务是改进一个医院文档问答管道。
    • 参与者迭代调试检索和生成组件,探索多样的管道配置,并保存答案以供评估。
    • 观察到一致的调试模式,包括优先验证检索和迭代的意义构建循环。
  • 局限性与未来工作:
    • 研究时间有限(1小时),未能捕捉生产级RAG开发的全部复杂性。
    • 需要更好的溯源跟踪、跨多个轨迹的系统化评估,以及对更大文档语料库的支持。
    • 未来工具可以集成类似笔记本的功能,支持预处理任务,并适配自定义检索方法。

总结

raggy通过支持快速实验、交互式调试和系统化评估,解决了RAG管道开发中的关键挑战。其基于Python的原语和浏览器界面使开发者能够动态调整参数、可视化检索和生成输出,并保存答案以进行长期测试。一项用户研究证明了其在减少迭代时间和支持多样化调试策略方面的有效性。未来的工作可以扩展raggy的功能,以更好地支持大规模生产环境和更系统化的评估工作流。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/221901/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790874
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
最佳论文
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、原型设计与用户测试
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文