偏好引导的提示优化用于文生图生成

生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作创意协作与反馈系统AI/ML 研究员与工程师UI/UX 设计师HCI 研究员

文献标题

Preference-Guided Prompt Optimization for Text-to-Image Generation

出版信息

  • 主题领域: 面向人类中心的生成模型提示优化。
  • 关键词: 文本到图像生成, 提示优化, 用户偏好, 生成模型, 探索-利用平衡, 自适应优化, 二元反馈, 人机协作。

背景与问题

  • 问题/挑战: 为生成模型设计有效的提示具有挑战性,因为用户目标隐含、生成过程不透明,以及手动优化提示的认知负担较高。现有方法要么过度依赖人工努力,要么依赖数值奖励函数,而这些方法不适合需要稀疏反馈和快速收敛的人类中心任务。
  • 重要性: 在减少用户提示优化工作量的同时实现令人满意的生成结果,对于使生成模型在创意任务中变得可用且高效至关重要。
  • 动机与相关工作: 之前的方法包括手动提示优化工具、基于数值函数的自动优化,以及结合用户反馈的迭代优化。然而,这些方法要么增加了认知负担,要么无法适应多样化的用户目标。目前仍存在一个空白,即如何在最小化用户输入(如二元偏好反馈)的情况下实现自动优化。

解决方案

  • 提出的方法: 自适应偏好提示优化(APPO),一种仅基于用户偏好反馈优化提示的方法,用于指导文本到图像生成任务。
  • 创新点:
    1. APPO 引入了三种互补策略:保留、对齐和扩展,以平衡探索与利用。
    2. 自适应策略根据提示之间的语义相似性动态调整探索强度。
    3. APPO 通过依赖二元偏好反馈而非手动编辑或数值评分,最大限度地减少用户工作量。
    4. APPO 通过一致性检查机制确保初始提示中的关键信息得以保留。
  • 流程与关键技术:
    • 保留(Retainment): 保留前几次迭代中用户偏好的提示以保持稳定性。
    • 对齐(Alignment): 使用文本梯度将非偏好提示优化为更符合用户偏好的方向。
    • 扩展(Expansion): 应用进化算法(交叉和变异)探索提示空间中的多样化方向。
    • 自适应策略(Adaptive policy): 根据语义相似性调整变异强度,以平衡探索与利用。
    • 一致性检查(Consistency check): 确保优化后的提示保留初始提示中的关键信息。

结果

  • 具体发现:
    • 在合成测试中,APPO 提高了 19.64%,而消融变体仅提高了 9.38–14.66%。
    • 在合成测试中,APPO 优于 TextGrad(6.45%)和 Self-TICK(8.06%)。
    • 用户研究中,APPO 所需迭代次数和时间显著减少(平均 <4 次迭代,而基线方法 >6 次)。
  • 相较基线的优势:
    • APPO 展现了更快的收敛速度、更高的输出质量和更低的认知负担,相较于 PromptCharm、DSPy 和 Clarification 方法。
    • 参与者报告使用 APPO 时的心理和身体负担更低,挫败感更少,满意度更高。
  • 实验/评估:
    • 合成测试: 在受控场景下使用模拟用户反馈比较 APPO 和其变体。
    • 用户研究: 16 名参与者在四种条件下(APPO、PromptCharm、DSPy、Clarification)完成封闭式和开放式图像生成任务。指标包括迭代次数、时间、NASA-TLX 工作负荷和 CSI 分数。
  • 局限性与未来工作:
    • 对于高度具体或过于复杂的用户意图表现较弱。
    • 对需要动态目标或缺失关键信息的任务适用性有限。
    • 未来方向包括整合更丰富的用户反馈、扩展到多模态输入,以及利用共享偏好进行元学习。

总结

APPO 是一种以人为中心的提示优化方法,通过二元偏好反馈优化提示,使用户能够以最小的努力实现令人满意的文本到图像生成结果。通过保留、对齐和扩展策略平衡探索与利用,并采用自适应策略,APPO 能够有效收敛到高质量提示,同时保留关键信息。合成测试和用户研究表明,与现有方法相比,APPO 在效率、用户满意度和认知负担减少方面具有显著优势。APPO 为创意生成任务中的无缝人机协作迈出了重要一步,并具有扩展到其他领域和多模态输入的潜力。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222041/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791443
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、创意协作与反馈系统
work
职业/产业
AI/ML 研究员与工程师、UI/UX 设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文