自适应滑块:基于用户对齐语义滑块的文本到图像模型输出编辑

生成式AI(文本、图像、音乐、视频)可解释人工智能(XAI)UI/UX 设计师HCI 研究员

研究背景与问题

  • 挑战与问题:

    • 精确地编辑文本到图像模型的输出是一项复杂任务,尤其是在调整图像的语义属性时。现有滑杆式编辑方式面临了多个用户中心问题:
      1. 滑杆的变化范围不一致,导致难以控制变化的强度。
      2. 默认的滑杆范围往往既不适合实际需要,也容易生成超出正常范围的图像。
      3. 调整一个属性会意外影响其他属性,因图像潜在空间的复杂纠缠性。
  • 问题重要性:

    • 文本到图像生成模型(如Stable Diffusion、DALL-E等)已广泛应用于创意设计,但其生成结果常无法满足用户的具体需求。这使得对模型生成结果进行细粒度语义控制变得至关重要。
  • 研究动机与相关工作:

    • 为解决上述挑战,已有研究提出通过滑杆操作潜在空间来编辑图像语义属性。然而,这些系统在实际应用中常因滑杆范围不准确和属性纠缠等问题显得不够实用。针对这些问题,本工作尝试优化滑杆编辑工具,使其更符合用户需求。

解决方案

  • 方法与工具:

    • 提出了一种名为 AdaptiveSliders 的工具,可根据用户的输入调整滑杆的边界和变化,优化用户操作体验。具体改进包括:
      1. 自动建议与用户提示相关的语义属性滑杆,减轻用户负担。
      2. 基于视觉问答(VQA)模型选择与用户提示语义更一致的初始图像作为滑杆值0的参考。
      3. 在滑杆范围内生成一致的视觉变化,优化滑杆操作的线性映射。
      4. 动态调整滑杆的上下限避免滑杆变化超出逻辑范围,同时限制对其他未调整属性的影响。
  • 创新之处:

    • 初始图像语义对齐: 使用VQA模型根据用户提示从多张候选图像中选择最具语义一致性的图像。
    • 动态范围映射: 滑杆范围根据具体属性和图像动态调整,避免生成无意义或杂乱的变化。
    • 一致性变化优化: 基于LPIPS图像相似性度量,线性化滑杆值与图像变化间的对应关系。
    • 多属性合成编辑: 使用LoRA合成算法减少多属性同时编辑时的潜在纠缠问题。
  • 实施步骤:

    1. 用户输入生成图像的文本提示。
    2. AdaptiveSliders 分析提示并建议语义属性,并生成初始图像。
    3. 滑杆的范围和变化方式动态设定,并允许用户进行编辑。
    4. 编辑后的图像存储于历史轨迹中供用户回溯查看。

研究成果

  • 具体成果与验证实验:

    • 初始图像对齐: AdaptiveSliders 所生成的初始图像在语义上与用户提示更一致。实验数据表明其 ImageReward 评分显著优于基线模型。
    • 滑杆范围优化: 对比固定范围滑杆,用户更偏好 AdaptiveSliders 所设定的动态范围。71%的样本中用户选择了AdaptiveSliders作为较优选项。
    • 一致性变化验证: 评估中,用户认为AdaptiveSliders在大部分属性编辑中提供了更线性和一致的变化效果,优于基线模型。
    • 用户研究结果: 在滑杆操作任务中,AdaptiveSliders显著减少任务完成时间(5-slider任务中减少约19%)和滑杆调整次数,同时降低用户的认知负担(降低了NASA-TLX的心理需求和努力评分)。
  • 优势与比较:

    • 与传统固定范围滑杆工具相比,AdaptiveSliders 改进了人工交互的一致性和滑杆范围的逻辑性,不仅优化了使用体验,还提高了最终编辑结果的质量。
  • 局限性与未来方向:

    • 局限性:
      1. 多属性编辑时仍存在潜在空间方向纠缠问题,导致滑杆间干扰。
      2. 图像生成耗时较长,需要优化计算效率以支持实时操作。
    • 未来方向:
      1. 采用更先进的多方向合成方法减少属性纠缠。
      2. 探索将滑杆编辑工具与其他编辑技术(如图像修复、补全等)结合以扩展功能。
      3. 测试该工具在其他生成模型(如GAN、VAE)上的通用性和有效性。

这项研究的成果为文本到图像生成工具的交互性和用户体验提供了重要的提升,适合在创意设计、数字艺术等领域的实际应用中推广。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/189331/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714292
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、可解释人工智能(XAI)
work
职业/产业
UI/UX 设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文