启发式发现:使用Dreamsheets为AI艺术创作进行灵活的意义构建
作者
生成式AI(文本、图像、音乐、视频)AI 辅助创意写作平面设计与排版工具软件工程师与开发者UI/UX 设计师视觉艺术家与设计师
文献标题
Prompting for Discovery: Flexible Sense-Making for AI Art-Making with DreamSheets
文献信息
- 主题领域: 人机交互与生成式AI艺术创作
- 关键词: 生成式AI, 文本到图像, 设计空间探索, 提示工程, 可视化
研究背景与问题
-
发现的问题或挑战:
- 文本到图像(TTI)模型的输入空间和输出空间都极为庞大且不透明,用户难以理解输入与输出之间的关系。
- 商业TTI界面对探索性和提示工程支持有限,大多数现有工具仅提供基本提示文本框和少量的输出结果展示。
- 缺乏全面的界面工具帮助用户系统地探索提示空间,以实现目标结果或理解模型生成机制。
-
问题重要性:
- 随着生成式AI模型在艺术创作中的普及,如何理解和掌握TTI模型的输入-输出映射成为核心挑战。只有通过有效探索,用户才能在生成式AI中实现创作目标并推动模型的创新应用。
-
研究动机与相关工作:
- 当前研究已关注生成式模型交互界面改进(如Promptify、GanZilla等),但这些工具通常偏向于优化单次生成而非支持大规模探索。
- 相关文献研究提示工程技术与大规模结果展示的潜力,但没有针对TTI模型全面探索界面的长时分析。
- 本研究旨在通过DreamSheets工具弥补现有研究和工具的不足,为TTI探索和感知构建灵活支持。
解决方案
-
提出的方法或解决方案:
- 构建DreamSheets,一个基于电子表格的创新工具,允许用户定义提示探索系统,结合自定义的提示生成功能和图像生成功能。
- 提供一系列基于大语言模型(LLM)的电子表格函数(如生成同义词、替代描述或语义扩展等),为用户提示多样性和探索性提供支持。
- 内嵌动态二维展示界面,通过拖拽和自动填充等功能,用户可轻松比较输入输出关系或批量生成和分类图像。
-
创新之处:
- 提供高度灵活的探索界面,支持用户从提示输入到图像输出的全流程感知和控制。
- 结合表格公式构建与LLM辅助功能,建立可扩展的“提示探索轴”和图片大规模动态生成布局。
- 聚焦于探索过程中的“sense-making”阶段,通过支持构建探索结构,帮助用户迭代生成系统和发展输入-输出直觉。
-
实施步骤与关键技术:
- 功能设计: 在Google Sheets中嵌入TTI()函数用于图像生成,以及GPT()等函数用于提示操作或扩展。
- 系统实现: 使用Google Apps Script和后端代理服务器连接Stability.ai和OpenAI API进行多线程处理,确保TTI和LLM调用的高效性。
- 用户评估: 进行初步实验室研究和为期两周的专家研究分别探索新手用户和专家用户的探索习惯与工作流构建方法。
研究成果
-
取得的具体成果:
- DreamSheets允许用户构建动态提示模板,实现多维度大规模探索和对生成结果的综合评估。
- 提出的工具成功支持了用户通过组合多维探索轴(如种子、语义变换、不同提示部分)进行有针对性的图像生成。
- 总结出一系列探索模式,包括迭代提示优化、参数变换(种子与CFG滑块)以及以LLM支持的语义探索等。
-
与现有解决方案的优势:
- 相较于传统“单一输入-输出”的TTI工具,DreamSheets支持多维、逐层和可重复性的探索,使用户能够更深刻理解TTI模型语义。
- 系统结合灵活性和可组合特性,用户能自定义工作流程并实现广泛的生成式实验。
-
实验或评估结果:
- 在实验室研究中,12位参与者成功完成了提示工程任务,即使多数人缺乏TTI使用经验。
- 在专家研究中,五位分析师自主扩展和改进了DreamSheets系统,其中最多的用户实现了超过11,000次的生成调用,显现出工具对自由探索的高适配性。
-
局限性与未来方向:
- 局限性:
- 研究主要面向特定TTI模型与有限的参数维度,未来需考虑对更复杂参数空间的支持。
- 工具功能目前对部分高级生成控制(如ControlNet、图像编辑等)缺乏直接支持。
- 未来方向:
- 扩展对空间条件输入、在生成图像基础上的多样化改良和图像到文本转换等功能的支持。
- 促进不同AI模型之间的交互性,强化工作流模块化。
- 探讨如何更深入支持创作者在“探索深度”与“探索宽度”中的灵活切换。
- 局限性:
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何设计一个工具帮助用户直观探索文本生成图像(TTI)模型的输入输出关系?分类: 电子表格中的自然语言公式同类问题arrow_forward
- 用电子表格结合大语言模型(LLMs)功能,能否有效提升用户的提示词探索效率?分类: 电子表格中的自然语言公式同类问题arrow_forward
- 用户如何通过多维度探索模式优化TTI生成的视觉效果?分类: 电子表格中的自然语言公式同类问题arrow_forward
lightbulb
现实痛点
1- 创造性用户难以理解和控制文本生成图像模型的输入输出关系。分类: 电子表格中的自然语言公式同类问题arrow_forward
- 71%
PromptCharm: 通过多模态提示和优化的文本到图像生成
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 71%
视觉概念的创意融合
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 71%
改进AI生成艺术中的主体表现:使用图像提示与文本到图像生成模型的设计指南
C&C '22· 生成式AI(文本、图像、音乐、视频) +2
- 67%
FlatMagic:通过AI驱动的设计改进数字漫画专业人士的平涂上色
CHI '22· 生成式AI(文本、图像、音乐、视频) +1
- 67%
GenColor: 视觉设计中的生成性颜色-概念关联
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 67%
工具何时为工具?用户对人-AI协同创作绘画中系统代理性的感知
DIS '23· 生成式AI(文本、图像、音乐、视频) +1
- 67%
基于生成模型的图形设计连续与渐进式风格变化
IUI '21· 生成式AI(文本、图像、音乐、视频) +1
- 63%
POET: 支持文本到图像生成的提示创意与个性化自动化扩展
UIST '25· 生成式AI(文本、图像、音乐、视频) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642858
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、AI 辅助创意写作、平面设计与排版工具
work
职业/产业
软件工程师与开发者、UI/UX 设计师、视觉艺术家与设计师
article
内容状态
已索引正文
hub
相关论文
8 篇相关论文