数据与提示词协同演化:通过扩展测试集优化大语言模型行为
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统用户研究方法(访谈、调查、观察)原型设计与用户测试软件工程师与开发者AI/ML 研究员与工程师HCI 研究员
文献标题
Data-Prompt Co-Evolution: Growing Test Sets to Refine LLM Behavior
出版信息
- 主题领域: 通过提示和测试数据的协同进化优化大型语言模型(LLMs)的交互式工作流程。
- 关键词: 大型语言模型, 提示工程, 测试集进化, 人类参与, 策略优化, 交互式系统, 内容审核, 迭代工作流程, 人工智能对齐, 数据合成。
背景与问题
- 问题/挑战: 传统工作流程将测试数据和提示指令视为独立且静态的组件,导致在优化LLM行为时效率低下。目前的实践依赖于临时的提示调整或阶段性测试,无法系统性地解决边界案例或特定应用场景中的复杂策略问题。
- 重要性: 填补这一空白对于构建健壮且策略敏感的LLM应用至关重要,尤其是在LLM被广泛应用于需要细致入微、情境特定行为的多样化领域时。
- 动机与相关工作: 先前的研究探讨了提示优化、交互式机器学习和红队测试,但这些方法通常缺乏测试集扩展与提示优化之间的整合。本研究基于这些基础提出了一种统一的迭代工作流程。
解决方案
- 提出的方法: 数据-提示协同进化,一种将测试数据和提示指令作为相互依赖的过程进行迭代优化的工作流程。
- 创新点:
- 一个将测试集扩展与提示优化整合为相互依赖过程的结构化工作流程。
- 一个支持边界案例发现、理由提取、邻域探测和回归测试的交互式系统。
- 实证验证表明,与基线相比,该方法显著提高了用户意图与模型行为之间的对齐程度。
- 流程与关键技术:
- 发现失败案例: 系统生成具有挑战性的输入以暴露提示的弱点。
- 阐明理由: 用户标注失败案例并提供理由,同时获得AI生成的建议支持。
- 邻域探测: 合成相似的示例以测试理由的泛化能力。
- 优化规范: 根据理由和测试结果修订提示指令。
- 测试集评估: 在逐步扩展的测试集上测试修订后的提示,包括自动化和人工评估。
结果
- 具体发现:
- 协同进化工作流程生成的提示指令更长、更详细(平均111.1字 vs. 基线的81.2字)。
- 使用协同进化生成的测试集更大(平均14.19个示例 vs. 基线的7.94个示例),且更有效地暴露模型失败(失败率51.9% vs. 基线的26.7%)。
- 模型输出与用户意图之间的对齐显著提高(F1分数:0.69 vs. 基线的0.56)。
- 相较基线的优势:
- 提示指令的特异性更高,包括更明确的例外情况和具体示例。
- 模型行为的变化更一致且更有意义。
- 提升了用户对系统在策略对齐能力上的满意度和信心。
- 实验/评估:
- 基于模拟的实验,使用确定性角色测试失败发现和指令优化。
- 控制用户研究(N=16),比较协同进化与基线提示编辑界面在两个内容审核领域的表现。
- 评估指标包括提示长度、测试集大小、对齐度(F1分数)以及用户主观满意度。
- 局限性与未来工作:
- 二元正确/错误标注限制了对模糊案例的处理能力。
- 生成的示例缺乏多样性,需要改进语义多样性的生成机制。
- 在处理大型动态测试集和协作团队工作流程时面临扩展性挑战。
- 可能过度依赖LLM作为评判者,需要防范自动化偏差的机制。
- 将工作流程扩展到开放式生成任务和模型参数更新。
总结
本文提出了数据-提示协同进化的概念,通过测试数据和提示指令的迭代优化来改进LLM行为。所提出的交互式系统使用户能够识别边界案例、阐明理由并系统性地优化提示,从而生成更丰富的测试集并更好地对齐用户意图与模型输出。用户研究和模拟实验的实证结果表明,与传统提示编辑工作流程相比,该方法具有显著优势。未来研究方向包括解决标注中的模糊性、增强示例多样性,以及将工作流程扩展到协作和开放式任务中。此方法推动了负责任的、以人为中心的人工智能系统的设计进程。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 100%
DALL:基于数据编程和大型语言模型增强的主动学习进行数据标注
CHI '26· 大语言模型(LLM)的人机协作 +3
- 100%
居于循环之中:面向提示的快速运行时反馈
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
访谈驱动的生成代理用于产品发现:一项验证研究
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
"我们是否要深入探讨?":为异步在线讨论中推进知识共建设计并评估LLM智能体策略
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
即时目标:一种用于专业人工智能交互的通用方法
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
TurnStyle:一个分析人类对话行为以预测LLM辅助任务成功的框架
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
Perspectra:选择专家增强多智能体研究创意生成中的批判性思维
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
“让我来帮忙”:人与网络代理协作中用户干预的实证研究
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
设计LLM的分阶段评估工作流程:整合领域专家、普通用户和模型生成的评估标准
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
隐形导师:从屏幕录制推断用户操作以推荐更好的工作流程
CHI '26· 大语言模型(LLM)的人机协作 +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791222
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文