SketchFlex:使用基于区域的草图在文本到图像生成中促进空间语义一致性

荣誉提名
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作软件工程师与开发者UI/UX 设计师自由职业者(设计、写作、翻译)

研究背景与问题

  • 发现的问题或挑战: 现有的文本到图像生成模型(Text-to-Image Generation Models, T2I)能够生成高质量图像,但对于非专业用户来说,以粗略草图来控制图像生成的语义和空间连贯性仍存在困难。这主要表现为:

    1. 用户难以基于草图创建合适的文本提示(Prompts),尤其是多对象场景中的语义关系描述。
    2. 粗略草图质量普遍较低,导致生成的图像不符合语义逻辑,例如对象缺失、不自然关系和错误场景等。
    3. 现有模型多为端到端生成,缺乏迭代调整机制,用户无法针对具体区域进行单独优化。
  • 重要性: 粗略的草图控制为非专业用户提供了易于操作的生成方式,但其准确性和连贯性的问题限制了实际应用。解决这一痛点对提高交互式生成工具的实用性和效率至关重要,尤其是对创意设计和艺术生成领域具有重要意义。

  • 研究动机与相关工作: 研究动机主要是满足非专业用户通过草图与简单提示生成复杂且语义连贯图像的需求。已有研究多关注提示文本优化或空间条件控制,但通常要求高精度输入或无法满足用户迭代生成的需求,缺乏对用户粗略输入的支持。

解决方案

  • 提出的方法/解决方案: 作者提出了一个名为 SketchFlex 的交互系统,允许用户通过粗略区域草图和简单文本提示生成高质量且语义连贯的图像。该系统包括以下核心模块:

    1. 草图感知的提示建议:通过多模态大语言模型(MLLM)结合语义空间为用户推荐与草图匹配的初始提示,减少用户负担。
    2. 空间条件草图优化:将用户粗略绘制的草图细化为高质量的空间条件,保证生成结果准确性。
    3. 迭代交互接口:设计用户界面支持草图控制和提示编辑,方便用户在多个生成迭代中逐步改进图像。
  • 创新之处:

    1. 融合用户草图和文本提示,自动生成语义全面的提示。
    2. 提出 “分解与重组成策略”(Decompose-and-Recompose Strategy),逐步优化单个对象草图,并整合多个对象的空间条件。
    3. 提供面向非专业用户的自由交互界面,支持草图区域调整和多个生成迭代。
  • 实施步骤与关键技术:

    1. 创建语义空间,定义图像生成所需的关键语义维度,包括单个对象的类型、属性、状态,以及多个对象之间的方向和语义关系。
    2. 提取用户输入的草图和初始提示,通过多模态模型和外部数据集(如Visual Genome和VAW)生成建议提示。
    3. 运用分解与重组成策略,精炼单个对象草图并生成候选形状,结合用户调整合并为最终图像锚定条件。
    4. 利用Canny边缘检测器和ControlNet模型实现精确的形状锚定,以确保生成图像与用户意图的一致性。

研究成果

  • 具体成果:

    1. SketchFlex 能生成语义连贯且高质量的图像,显著降低了用户的认知负担。
    2. 一项用户研究表明,与现有方法相比,SketchFlex 更贴合用户意图,提供了高度可控性和灵活性。
    3. 实验结果显示,系统在多对象图像生成中的表现超过现有端到端生成模型和区域生成模型。
  • 与现有解决方案相比的优势:

    1. 用户可以迭代生成并修改部分图像对象,而无需重新生成完整图像。
    2. 系统支持自由调整草图以及精炼提示,显著提高了非专业用户的生成质量。
    3. 提供了优化后的提示建议,使得生成结果更加稳定且符合语义预期。
  • 实验或评估结果:

    1. 用户满意度调查显示,SketchFlex 在图像质量、意图匹配度和图像连贯性方面均显著优于基线模型(T2I和R2I)。
    2. 在两个任务中,系统的表现以最接近参考图像的结果显示出更高的准确性和一致性。
  • 局限性与未来方向:

    1. 当涉及三个或以上语义相似的对象时,可能出现对象丢失的情况。
    2. 系统无法对细薄的草图笔触进行精确理解,限制了专业用户的使用体验。
    3. 针对更复杂的空间语义关系(如包含关系),模型生成能力仍需改进。
    4. 作者建议未来发展方向包括支持用户上传个人模型以增强定制能力、设计更复杂的过滤机制以避免不当内容,同时将细化草图与生成交互更无缝地融合。

总之,SketchFlex 在提升非专业用户的图像生成能力方面表现出色,同时也为交互式多模态生成系统的设计提供了有价值的思路。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188525/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713801
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
荣誉提名
group
作者
4 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
软件工程师与开发者、UI/UX 设计师、自由职业者(设计、写作、翻译)
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文