Noise Pilot:基于扩散模型的图像生成赋能艺术工作流创作
荣誉提名作者
生成式AI(文本、图像、音乐、视频)创意协作与反馈系统代码创作与计算艺术游戏开发者与设计师视觉艺术家与设计师HCI 研究员
文献标题
Noise Pilot: Enabling Artistic Workflow Composition with Diffusion-Based Image Generation
出版信息
- 主题领域: 基于扩散模型的图像生成创意支持工具。
- 关键词: 扩散模型,图像生成,创意支持工具,节点式编程,艺术工作流,物质性,透明化抽象,生成式人工智能,迭代去噪,计算艺术。
背景与问题
- 问题/挑战: 现有的AI创意工具将扩散模型视为黑箱系统,艺术家只能通过间接操作(如提示词)或需要高级机器学习工程技能进行定制。这限制了创意控制和探索的可能性。
- 重要性: 提供更深入的扩散过程交互能力可以赋能艺术家创作新颖且定制化的作品,从而推动计算艺术的创新。
- 动机与相关工作: 现有工具如DALL-E和ComfyUI对扩散内部的控制能力有限。机器学习文献中已有定制扩散的技术,但对非程序员来说难以访问。本研究旨在通过提供多层次的界面来弥合这一差距,支持艺术探索。
解决方案
- 提出的方法: Noise Pilot,一个基于节点式编程的环境,用于创建基于扩散模型的图像生成工作流,允许艺术家以不同深度操控扩散过程。
- 创新点:
- 引入支持提示词、扩散流程设计和扩散定制的多层次界面。
- 将扩散过程(DDPM)实现为可编辑的节点,提供细粒度控制。
- 展示工具再现前沿技术并开发新技术的能力。
- 通过为期两周的用户研究评估工具对创意实践的影响。
- 方法与关键技术:
- 在节点式界面中表示DDPM算法。
- 允许用户组合扩散与图像处理操作的工作流。
- 提供常见扩散技术(如视觉字谜、生成式填充)的模板和教程。
- 支持用户定制迭代去噪过程以生成定制化输出。
结果
- 具体发现:
- 参与者在研究期间创建了167个工作空间,生成了7,295张图像。
- 观察到3,183次提示词修改、3,794次流程编辑和2,364次扩散定制。
- 艺术家创作了仅通过提示词无法实现的作品,如视觉字谜和混合图像。
- 相较基线的优势:
- 与ComfyUI等工具相比,Noise Pilot支持更深入的扩散过程交互,启发了新的艺术工作流。
- 艺术家报告称,这种体验更像是雕刻材料,而不仅仅是发出提示。
- 实验/评估:
- 对9位计算艺术家进行为期两周的部署研究。
- 参与者平均使用工具约10小时,提交了反思并参与了访谈。
- 分析揭示了三种交互深度(提示词、流程、定制)上的多样化策略。
- 局限性与未来工作:
- 分辨率限制在256x256,制约了某些风格(如照片写实主义)。
- 不支持模型训练或数据集层面的操作。
- 未来工作可探索更高分辨率、替代模型,以及区分模型设计与界面设计影响。
总结
Noise Pilot是一款基于节点的创意支持工具,使艺术家能够以不同深度操控基于扩散模型的图像生成过程。通过将DDPM算法实现为可编辑节点,该工具支持提示词、工作流组合以及扩散过程的直接定制。对9位艺术家的两周研究表明,其能够支持新颖的艺术工作流,并促进艺术家将扩散视为一种媒介进行物质化操作。尽管受限于分辨率和缺乏训练层面的控制,Noise Pilot展示了设计生成式AI工具的潜力,这些工具通过可见性、灵活性和材料般的操控赋能艺术家。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790531
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、创意协作与反馈系统、代码创作与计算艺术
work
职业/产业
游戏开发者与设计师、视觉艺术家与设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文