CoPrompter:面向用户的LM指令对齐评估以改进提示工程
作者
大语言模型(LLM)的人机协作可解释人工智能(XAI)AI 辅助决策与自动化系统软件工程师与开发者AI/ML 研究员与工程师
确保大型语言模型(LLM)的响应与提示指令对齐对于应用开发至关重要。基于我们与行业从业者的形成性研究,当提示中有大量指令时,对齐需要大量人工参与和繁琐的试错过程。为了应对这些挑战,我们引入了 CoPrompter,一个基于评估多个 LLM 响应与标准来识别不对齐的框架。它提出了一种从提示要求直接派生评估标准问题的方法,以及一个将这些问题转换为用户可编辑清单的界面。我们与行业提示工程师的用户研究表明,CoPrompter 提高了识别和优化与提示要求指令对齐的能力,帮助他们了解模型未能遵循用户提示要求的频率和位置,并帮助他们澄清自己的要求,使他们在响应评估过程中获得更大的控制权。我们还展示了设计经验,以强调我们系统在简化提示工程过程中的潜力。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何评估大语言模型(LLMs)在执行复杂多指令提示时的指令对齐性能?分类: LLM 提示工程与编写工具同类问题arrow_forward
- 用户参与的动态评估框架能否改进提示工程的效率和结果质量?分类: LLM 提示工程与编写工具同类问题arrow_forward
- 通过分解和自动化生成评估标准,是否能更精准地识别LLMs的对齐问题?分类: LLM 提示工程与编写工具同类问题arrow_forward
lightbulb
现实痛点
1- 用户在复杂任务时无法高效评估和优化大语言模型的指令效果。分类: LLM 提示工程与编写工具同类问题arrow_forward
- 100%
多智能体AI系统的交互式调试和引导
CHI '25· 大语言模型(LLM)的人机协作 +2
- 100%
DIY:帮助人们评估自然语言到SQL系统的正确性
IUI '21· 大语言模型(LLM)的人机协作 +2
- 83%
基于模型的强化学习适应用户界面
CHI '21· 大语言模型(LLM)的人机协作 +2
- 83%
结果-可行动性差距:理解从业者如何在实际环境中评估 LLM 产品
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
DataSpeck:一种人工智能驱动的端到端人机协作系统,用于实现数据转换工作流的自动化
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
看不见的破坏者:谄媚型大语言模型在问题解决任务中误导新手
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
响应延迟和任务类型对人类-LLM 交互与感知的影响
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
与我共编还是为我编程?AI 自动化程度提升如何改变开发者工作流
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
RAGTrace:理解和改进检索增强生成中的检索-生成动态
UIST '25· 大语言模型(LLM)的人机协作 +2
- 80%
UMLAUT:使用程序结构和模型行为调试深度学习程序
CHI '21· 可解释人工智能(XAI) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3708359.3712102
一眼看懂
fact_check论文快照
dataset
来源
IUI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI 辅助决策与自动化系统
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文