PromptCharm: 通过多模态提示和优化的文本到图像生成

生成式AI(文本、图像、音乐、视频)可解释人工智能(XAI)AI 辅助创意写作软件工程师与开发者UI/UX 设计师视觉艺术家与设计师

文献标题

PromptCharm: Text-to-Image Generation through Multi-modal Prompting and Refinement

文献信息

  • 主题领域: 人机交互、生成式 AI、文本到图像生成
  • 关键词: Generative AI, Prompt Engineering, Large Language Models, Text-to-Image Generation, Human-AI Interaction, Model Attention

研究背景与问题

  • 作者发现了哪些问题或挑战?
    • 当前生成式AI模型(如Stable Diffusion)在“文本到图像生成”中的表现优异,但对于新手用户来说,如何有效编写和优化提示词(prompt)以生成符合预期的高质量图像仍存在较高门槛。
    • 现有系统缺乏用户友好的反馈机制,比如如何解释生成图像与提示词的对应关系,以及如何有效调整模型生成与用户意图之间的差距。
  • 为什么这个问题很重要?
    • 提示词工程对生成式模型的表现至关重要,同时优化生成过程是提升模型实际应用效果的重要环节。
    • 随着生成式AI的普及,降低提示词编写门槛和提升互动体验可以让更多非专家用户参与这类技术。
  • 研究动机与相关工作:
    • 当前的研究多集中于自动化提示词优化(如Promptist模型),以及探索提示词工程的交互设计(如PromptMagician、PromptPaint),需要进一步结合模型解释与多模态交互增强用户体验。

解决方案

  • 作者提出了哪些方法或解决方案?
    • 提出并设计了一个混合型交互系统——PromptCharm,用于帮助用户通过多模态对提示词(prompt)进行优化、图像生成和反馈迭代。
    • PromptCharm的主要功能包括提示词自动优化、图像风格探索、模型注意力值可视化与调整以及图像修补(inpainting)。
  • 该解决方案的创新之处是什么?
    • 集成了多模态交互,并提供丰富的反馈循环解决生成内容与用户意图之间潜在差距。
    • 通过模型注意力值的可视化和调整,支持直接操作生成图像而非依赖于繁琐的提示词修改。
  • 实施步骤是什么?使用了哪些关键技术?
    • 提示词优化:利用微软的Promptist模型对用户输入的初始提示词进行自动优化。
    • 图像风格探索:使用标记后频率计数法,从DiffusionDB数据集中提取流行的“修饰词(modifiers)”支持风格选择。
    • 模型注意力可视化与调整:通过DAAM模型解释技术显示生成内容与提示词的文本内容的映射。
    • 图像局部修补:结合Stable Diffusion的修补功能,通过直接标记待替换区域再生成改动。

研究成果

  • 取得了哪些具体成果?
    • PromptCharm显著降低了用户对提示词编写和优化的学习成本,使非专家用户同样能够生成高质量、符合预期的图像。
    • 用户感受到更强的控制权,同时通过模型注意力地图更直观地理解生成结果。
  • 与现有解决方案相比,它有哪些优势?
    • PromptCharm超越了基线工具和已有自动优化工具(如Promptist),通过增强交互与反馈帮助用户显著提升生成效果。
    • 通过注意力调整和图像修补,用户无需频繁改写提示词即可解决生成内容与意图的差距。
  • 实验或评估结果是什么?
    • 两项用户研究结果:
      1. 封闭任务研究:参与者生成的图像与目标图像的结构相似度(SSIM)在使用PromptCharm时平均达到0.648,显著优于基线工具(0.479)和Promptist(0.574)。
      2. 开放任务研究:参与者认为PromptCharm生成的图像更符合审美和更满足预期,在Likert评分中分别获得6.0的中位数(满分7)。
  • 局限性与未来方向:
    • 局限性:在生成较大面积图像修补时,目前修补区域可能与整体图像衔接欠佳;对于封闭源代码的生成模型(如DALL-E、MidJourney),难以实现注意力控制等高级特性。
    • 未来方向:提升修补算法性能,支持更多生成模型,同时扩展至更大批量的图像生成模式并探索多语言适配与文本修饰词详细解释功能。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/148288/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642803
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、可解释人工智能(XAI)、AI 辅助创意写作
work
职业/产业
软件工程师与开发者、UI/UX 设计师、视觉艺术家与设计师
article
内容状态
已索引正文
hub
相关论文
5 篇相关论文