偏好引导的提示优化用于文生图生成
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作创意协作与反馈系统AI/ML 研究员与工程师UI/UX 设计师HCI 研究员
文献标题
Preference-Guided Prompt Optimization for Text-to-Image Generation
出版信息
- 主题领域: 面向人类中心的生成模型提示优化。
- 关键词: 文本到图像生成, 提示优化, 用户偏好, 生成模型, 探索-利用平衡, 自适应优化, 二元反馈, 人机协作。
背景与问题
- 问题/挑战: 为生成模型设计有效的提示具有挑战性,因为用户目标隐含、生成过程不透明,以及手动优化提示的认知负担较高。现有方法要么过度依赖人工努力,要么依赖数值奖励函数,而这些方法不适合需要稀疏反馈和快速收敛的人类中心任务。
- 重要性: 在减少用户提示优化工作量的同时实现令人满意的生成结果,对于使生成模型在创意任务中变得可用且高效至关重要。
- 动机与相关工作: 之前的方法包括手动提示优化工具、基于数值函数的自动优化,以及结合用户反馈的迭代优化。然而,这些方法要么增加了认知负担,要么无法适应多样化的用户目标。目前仍存在一个空白,即如何在最小化用户输入(如二元偏好反馈)的情况下实现自动优化。
解决方案
- 提出的方法: 自适应偏好提示优化(APPO),一种仅基于用户偏好反馈优化提示的方法,用于指导文本到图像生成任务。
- 创新点:
- APPO 引入了三种互补策略:保留、对齐和扩展,以平衡探索与利用。
- 自适应策略根据提示之间的语义相似性动态调整探索强度。
- APPO 通过依赖二元偏好反馈而非手动编辑或数值评分,最大限度地减少用户工作量。
- APPO 通过一致性检查机制确保初始提示中的关键信息得以保留。
- 流程与关键技术:
- 保留(Retainment): 保留前几次迭代中用户偏好的提示以保持稳定性。
- 对齐(Alignment): 使用文本梯度将非偏好提示优化为更符合用户偏好的方向。
- 扩展(Expansion): 应用进化算法(交叉和变异)探索提示空间中的多样化方向。
- 自适应策略(Adaptive policy): 根据语义相似性调整变异强度,以平衡探索与利用。
- 一致性检查(Consistency check): 确保优化后的提示保留初始提示中的关键信息。
结果
- 具体发现:
- 在合成测试中,APPO 提高了 19.64%,而消融变体仅提高了 9.38–14.66%。
- 在合成测试中,APPO 优于 TextGrad(6.45%)和 Self-TICK(8.06%)。
- 用户研究中,APPO 所需迭代次数和时间显著减少(平均 <4 次迭代,而基线方法 >6 次)。
- 相较基线的优势:
- APPO 展现了更快的收敛速度、更高的输出质量和更低的认知负担,相较于 PromptCharm、DSPy 和 Clarification 方法。
- 参与者报告使用 APPO 时的心理和身体负担更低,挫败感更少,满意度更高。
- 实验/评估:
- 合成测试: 在受控场景下使用模拟用户反馈比较 APPO 和其变体。
- 用户研究: 16 名参与者在四种条件下(APPO、PromptCharm、DSPy、Clarification)完成封闭式和开放式图像生成任务。指标包括迭代次数、时间、NASA-TLX 工作负荷和 CSI 分数。
- 局限性与未来工作:
- 对于高度具体或过于复杂的用户意图表现较弱。
- 对需要动态目标或缺失关键信息的任务适用性有限。
- 未来方向包括整合更丰富的用户反馈、扩展到多模态输入,以及利用共享偏好进行元学习。
总结
APPO 是一种以人为中心的提示优化方法,通过二元偏好反馈优化提示,使用户能够以最小的努力实现令人满意的文本到图像生成结果。通过保留、对齐和扩展策略平衡探索与利用,并采用自适应策略,APPO 能够有效收敛到高质量提示,同时保留关键信息。合成测试和用户研究表明,与现有方法相比,APPO 在效率、用户满意度和认知负担减少方面具有显著优势。APPO 为创意生成任务中的无缝人机协作迈出了重要一步,并具有扩展到其他领域和多模态输入的潜力。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 100%
与生成式AI合作:模型主导和人类主导交互在人机共创中的实验评估
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 83%
我主导,你帮忙但只需提供足够的细节:理解与人工智能共同创作的用户体验
CHI '18· 生成式AI(文本、图像、音乐、视频) +2
- 83%
"控制是一个轨迹,而非一个点":在人机协同创作中概念化控制
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 83%
图像分类中协作式交互机器教学的研究
IUI '24· 大语言模型(LLM)的人机协作 +1
- 83%
GANzilla:在生成对抗网络中实现用户驱动的方向发现
UIST '22· 生成式AI(文本、图像、音乐、视频) +1
- 71%
AI增强的头脑风暴:研究LLM在团队创意生成中的应用
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 71%
生成式AI应用程序的设计原则
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 71%
理解人类与AI代理之间的非线性协作:创意设计的共同设计框架
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 71%
多用户与AI代理的协作文档编辑
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
减少重绘,多加探索:草图到图像的建议与补全
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791443
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、创意协作与反馈系统
work
职业/产业
AI/ML 研究员与工程师、UI/UX 设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文