GANravel: 在生成对抗网络中用户驱动的方向解缠

生成式AI(文本、图像、音乐、视频)创意协作与反馈系统UI/UX 设计师视觉艺术家与设计师

文献标题

GANravel: User-Driven Direction Disentanglement in Generative Adversarial Networks

文献信息

  • 主题领域: 人机交互与生成对抗网络(GANs)在图像编辑中的应用
  • 关键词: Generative Adversarial Networks, Disentanglement, Interactive Systems, Explainable-AI, StyleGAN, 用户主导, 图像编辑, 方向解缠, 创意, 萌图生成

研究背景与问题

  • 问题或挑战:

    1. GAN本质上是一个“黑箱”,用户难以控制生成过程。
    2. 编辑方向的语义属性常常纠缠在一起(如添加眼镜可能同时改变性别或年龄),导致生成结果不一致或不符合期望。
    3. 当前方向解缠方法主要基于算法驱动,难以满足用户的交互需求。
  • 重要性:

    • 解决方向解缠问题可以提高GAN在医学影像、艺术创作和图像编辑应用中的可用性,为人机协作提供更灵活的支持。
  • 研究动机:

    • 开发一种用户主导的交互式工具,使用户能够以直观和迭代的方式改善GAN生成的编辑方向。
  • 相关工作:

    • InterFaceGAN利用分类器和子空间投影实现方向解缠,但需要大量标注数据。
    • StyleGAN和GANformer通过设计改进架构以提高解缠性能,但无法捕捉用户特定的解缠需求。
    • GANzilla提供用户交互方法,但不能直接优化方向解缠质量。

解决方案

  • 提出的方法:

    • 开发GANravel工具,允许用户通过交互式框架迭代地解缠方向。
    • GANravel结合“全局解缠”和“局部解缠”两种方式以优化方向。
  • 创新之处:

    1. 支持用户主动参与和迭代优化生成方向,而不是完全依赖算法。
    2. 采用模型无关的设计,适配不同的GAN架构(如StyleGAN2和FastGAN)。
    3. 提供两种解缠方式:基于权重调整的全局解缠,以及基于掩膜的局部解缠。
  • 实施步骤:

    1. 用户选择若干正例和负例图片作为初始方向。
    2. 使用权重调整平衡全局属性(如年龄和性别)。
    3. 基于用户手动标注区域生成掩膜,对局部属性(如眼镜或嘴巴)进行一次性解缠。
    4. 用户在实时测试界面验证方向效果,并保存最终的解缠方向。
  • 关键技术:

    • 在StyleGAN2中使用StyleSpace实现解缠,利用卷积滤波器输出定义方向。
    • 局部解缠通过掩膜筛选显著区域,无需额外训练。

研究成果

  • 具体成果:

    1. GANravel在两项用户研究中表现出色,参与者能够成功解缠方向。
    2. 编辑结果比现有算法(如InterFaceGAN、GANzilla)更具解缠效果。
  • 与现有解决方案相比的优势:

    • GANravel解缠方向更加有效,支持用户交互式调整方向并应用于多种场景(包括人脸编辑和狗狗萌图生成)。
    • 提供灵活的用户接口,使用户以直观方式发现并解缠方向。
  • 实验或评估结果:

    1. 在第一项实验中,与GANzilla和StyleFlow等基线方法相比,GANravel的生成结果身份保留率较高(平均值达到0.84)。
    2. 第二项实验表明GANravel不仅能单独工作,还可以结合其他方向发现方法以改善方向(比如改进GANzilla的已发现方向)。
    3. 用户通过迭代调整显著提高方向解缠效果;平均完成任务时间为9分钟以内。
  • 局限性与未来方向:

    1. 用户任务中方向的泛化性有限,部分测试图片无法被成功编辑。
    2. 需要探索与其他算法结合的最优解决方案。
    3. 提供用户指导和决策反馈机制,比如通过热图和解缠性能指标。
    4. 为用户减少重复解缠任务设计自动化方案。
    5. 优化图像选择过程,并探索自然语言交互来快速定义目标方向。

总结

GANravel作为一种用户主导的交互工具,为解缠方向的优化提供了一种全新且灵活的方法,为未来在用户与生成模型交互领域的研究奠定了基础。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/95720/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581226
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、创意协作与反馈系统
work
职业/产业
UI/UX 设计师、视觉艺术家与设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文