Promptify:基于大语言模型的交互式提示词探索实现文本到图像生成
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作AI 辅助创意写作UI/UX 设计师
文献标题
Promptify: Text-to-Image Generation through Interactive Prompt Exploration with Large Language Models
文献信息
- 主题领域: 人机交互中的文本到图像生成与提示工程
- 关键词: 文本到图像生成,提示工程,大语言模型,交互设计,人工智能图像生成
研究背景与问题
-
发现的问题或挑战:
- 文本到图像生成模型(如Stable Diffusion和DALL-E 2)虽然非常强大,但用户在撰写有效的提示以表达复杂创意方面存在困难。
- 提示撰写通常需要繁琐的试错过程,而系统缺乏支持用户发现关键词的内置功能。
- 新手用户对相关关键词及提示设计不熟悉,难以有效管理生成的大量随机图像。
-
重要性: 提示工程是该领域的关键任务,它直接影响生成图像的质量和风格。解决用户提示撰写的困难将极大提高文本到图像生成模型的应用效率,尤其是在创意领域。
-
研究动机与相关工作:
- 提示工程已有研究仅提供高层次的建议,并未针对不同用户的特定美学目标。此外,已有工具(如reddit社区和第三方工具)分享了部分信息,但无法完全满足个性化需求。
- 本文进一步通过用户访谈发现提示撰写难度、随机性管理和生成大批量图像分析的挑战。
解决方案
-
方法或解决方案: 作者提出了Promptify,一种支持交互式提示探索与优化的系统,结合大语言模型(LLM)和开放源码的Stable Diffusion模型。Promptify包括以下功能:
- 自动提示建议:基于用户输入的主题和样式,扩展并生成复杂提示。
- 图像布局与分类:通过图像的相似性进行分组和可视化,帮助用户组织和浏览生成的图像。
- 基于图像的优化建议:从生成的图像中提取特定关键词,辅助用户优化初始提示。
-
创新之处:
- 利用GPT-3.5作为提示建议生成引擎,对主题和风格进行分离式扩展,并支持用户通过自然语言动态调节提示生成方向。
- 结合CLIP Embedding对图像进行布局和聚类,帮助用户更高效地发现视觉趋势。
- 首次将LLM提示技术与文本到图像生成模型结合,跨模态设计提示工程工具。
-
实施步骤和关键技术:
- 使用零样本和少样本提示技术指导LLM生成复杂提示关键词。
- 通过CLIP和TSNE机制对图像进行视觉布局与聚类,标记并支持用户操作。
- 通过CLIP Interrogator从生成图像中提取关键词,指导提示优化。
研究成果
-
具体成果:
- 显著减少了用户撰写初始提示的认知负担,使新手用户首次生成时即可达到更高质量的图像效果。
- 自动提取关键词支持用户迭代优化提示,增强视觉呈现目标。
- 开发了完整的交互式用户界面,支持用户高效管理和比较生成的大批量图像。
-
优势:
- 与现有工具(如Automatic1111)相比,Promptify显著提高了提示工程的效率和用户体验。
- 用户在生成图像时报告更低的精神需求和挫折感。
-
实验或评估结果:
- 用户研究表明:Promptify在生成图像的美学质量、一致性以及简化认知负荷方面显著优于基线工具。
- 多数用户认为Promptify的主题和样式扩展以及图像布局和聚类功能非常实用,同时对提供的关键词建议也赞誉有加。
-
局限性与未来方向:
- 提供的关键词建议仍依赖现有的艺术家数据库,这对不熟悉相关艺术家信息的用户可能造成使用障碍。
- 当前系统未支持负面提示生成,未来可探索如何自动生成负面关键词以进一步优化图像生成。
- 提示生成中的随机性管理仍有待进一步技术提升,例如深入研究片段提示对生成细节的影响。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 用户在进行文本到图像生成时,哪些困扰阻碍了他们设计有效的提示词?分类: 生成式图像创作与编辑控制同类问题arrow_forward
- 如何通过交互式系统整合大语言模型(如GPT-3.5)与Stable Diffusion来优化用户的提示词创建?分类: 生成式图像创作与编辑控制同类问题arrow_forward
- 结合文本与图像跨模态技术,能否改善用户在大批量图像管理和审视中的体验?分类: 生成式图像创作与编辑控制同类问题arrow_forward
lightbulb
现实痛点
1- 用户难以设计适合生成复杂创意图像的提示词。分类: 生成式图像创作与编辑控制同类问题arrow_forward
- 80%
PhraseFlow:短语级输入的设计与实证研究
CHI '21· 生成式AI(文本、图像、音乐、视频) +2
- 75%
生成式人工智能的专业用户体验设计师的看法
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 75%
深思熟虑、困惑还是不可信:文本呈现如何影响对AI写作工具的感知
C&C '25· 生成式AI(文本、图像、音乐、视频) +2
- 75%
Patchview:基于生成式尘埃与磁铁可视化的大型语言模型驱动世界构建系统
UIST '24· 生成式AI(文本、图像、音乐、视频) +1
- 67%
ExpressEdit:基于自然语言和草图的视频编辑
IUI '24· 生成式AI(文本、图像、音乐、视频) +3
- 60%
素描NLP:一个探索设计语言智能正确事物的案例研究
CHI '19· 大语言模型(LLM)的人机协作 +1
- 60%
FlatMagic:通过AI驱动的设计改进数字漫画专业人士的平涂上色
CHI '22· 生成式AI(文本、图像、音乐、视频) +1
- 60%
探索支持设计师学习与基于AI的制造设计工具协同创造的挑战与机遇
CHI '23· 生成式AI(文本、图像、音乐、视频) +1
- 60%
乐观主义:启用领域特定元启发式优化的协作实现
CHI '23· 生成式AI(文本、图像、音乐、视频) +1
- 60%
PopBlends:使用大型语言模型进行概念融合的策略
CHI '23· 生成式AI(文本、图像、音乐、视频) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3586183.3606725
一眼看懂
fact_check论文快照
dataset
来源
UIST
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、AI 辅助创意写作
work
职业/产业
UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文