WorldSmith:用于虚构世界构建的多模态图像合成工具

生成式AI(文本、图像、音乐、视频)AI 辅助创意写作平面设计与排版工具视觉艺术家与设计师自由职业者(设计、写作、翻译)

文献标题

WorldSmith: Iterative and Expressive Prompting for World Building with a Generative AI

文献信息

  • 主题领域: 人机交互、人工智能生成与虚拟世界构建
  • 关键词: 多模态图像生成, 虚拟世界构建, AI辅助创造力, 分层编辑, 表达性提示

研究背景与问题

  • 挑战: 虚拟世界的构建需要复杂而详尽的视觉呈现,这对缺乏艺术技能或者经验的创作者来说较为困难。现有的生成图像模型如Dall-E、Stable Diffusion等通常采用“一次点击”式的描述接口,但这无法满足虚拟世界构建中的迭代性需求。
  • 重要性: 在游戏、电影等娱乐形式中,一个精心构建的虚拟世界对成功至关重要。而快速且有效地视觉化世界能够加速创作者之间的协作,激发创造力。
  • 研究动机: 探索基于生成AI的表达性提示工具,支持用户以文本、绘图和区域绘制的多模态输入逐步创建复杂的视觉世界。

解决方案

  • 方法: WorldSmith 是一个专为虚拟世界构建设计的多模态生成工具,它能够从基底开始,通过分层编辑图像拼接和可视化的提示交互来迭代生成和改进虚拟世界。
  • 创新之处:
    • 支持文本、绘图和区域遮罩作为输入,通过非文本方式提供空间提示信息。
    • 引入分层生成与编辑,使用户能够从全局的图像拼接到局部细节逐步完善虚拟世界。
    • 提供树状视图追溯用户交互历史,支持探索不同的迭代路径。
  • 实施步骤:
    1. 文本输入:用户提供全局场景描述或特定区域的详细说明。
    2. 绘图和遮罩:用户通过绘制简略草图或指定区域为模型提供空间提示。
    3. 图像生成和编辑:基于用户定义的输入生成图像,并允许迭代改进,包括拼接多张图像。
    4. 树状视图:记录用户生成历史,可用于回溯或生成分支版本。

研究成果

  • 具体成果:
    • WorldSmith 使用户可以以交互性更高的方式利用提示生成模型,超越“一次点击”交互方式。
    • 通过13位参与者的用户研究,验证了该工具在虚拟世界构建中的实用性和高效性,能够帮助创作者快速生成初步草稿。
    • 总共生成了2748张图像,并完成了86次图像拼接操作。
  • 优势:
    • 支持绘图、区域划分等多模态输入,提升用户表达意图的能力。
    • 强调分层生成与编辑,支持从粗略到细节的创作流程。
    • 模拟虚拟世界构建的迭代性,增强用户对生成AI的控制感。
  • 实验与评估结果:
    • 用户总体对工具的易用性评价较高。通过问卷调查和行为记录发现,用户倾向于首先生成初稿,然后利用细节编辑逐步完善世界。
    • 树状交互模式对生成历史的追溯和分支探索有积极影响。
    • 几乎所有参与者认为多模态输入形式优于单文本提示。
  • 局限性与未来方向:
    • 图像拼接结果存在样式和视角不一致的潜在问题。可引入更精确的后处理机制如MultiDiffusion。
    • 对于更复杂的场景和资产生成,用户可能需要更多时间或相关技术支持。
    • 尚未处理虚拟世界构建中的其他维度,如叙事背景、音乐设计或角色塑造。

总结

WorldSmith通过分层生成和空间提示等方式超越了现有生成图像工具的“一次点击”交互限制,为创作者提供了更表达性和迭代性的工具。研究成果不仅展示了该工具在虚拟世界构建中的有效性,还提出了“分层提示”和“空间提示”作为更广泛AI提示交互设计的新方向。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/126668/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3586183.3606772
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、AI 辅助创意写作、平面设计与排版工具
work
职业/产业
视觉艺术家与设计师、自由职业者(设计、写作、翻译)
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文