Brickify:通过设计令牌上的直接操作启用表达设计意图规范

生成式AI(文本、图像、音乐、视频)平面设计与排版工具创意协作与反馈系统UI/UX 设计师产品设计师

研究背景与问题

  • 发现问题和挑战

    1. 当前通过自然语言提示(如文本)表达设计意图的方式存在困难,设计师需要压缩并准确表达模糊的视觉细节,但这一过程对设计师而言既繁琐又不够直观。
    2. AI 工具(如 DALL·E、MidJourney)虽然生成 aesthetics 图像表现优秀,但缺乏设计师所需的元素控制能力、尤其是在复杂设计任务中无法清晰表达“元素之间的关系”和细化多轮交互。
    3. 现有工具中,仅借助文本描述构建复杂的视觉描述时,不仅语言在表达连续属性(如大小、空间位置)方面过于离散,且人工多次输入(如参考图像的重新表述)也耗费大量精力。
  • 研究重要性

    1. 设计师不仅要求生成高质量结果,还需在设计决策过程中保持对元素的控制,特别是在一些需要多个元素相互关系明确的专业设计场景中。
    2. 通过视觉方式(而非文本)表达设计语言,可能更贴近设计师的思维模型,降低交流负担。
    3. 帮助实现 AI 和人类的高效协作,使 AI 更好理解设计师意图。
  • 研究动机与相关工作

    1. 当前工具的不足主要在于其线性、自上而下的表达方式无法准确支持复杂视觉疑问的译解。
    2. 相关领域开发了“分步骤文本提示”(modular prompting)、跨模态提升的语义理解工具和视觉直接操控工具,但它们仍在“元素如何构建为整体”这一方面制约明显。
    3. 因此需要一种新的视觉驱动交互范式,使视觉和交互的表达意图更加丰富与灵活。

解决方案

  • 方法解析: 作者提出了一种名为 Brickify 的视觉驱动交互范式,强调“直接操作设计代币”(direct manipulation on design tokens)的方式,帮助用户明确表达需要的设计元素及其关系。

    • 设计代币(Design Tokens):将视觉元素(如主体、颜色、风格等)明确化为交互图形化表示对象。
    • 设计意图的建构与操作:用户通过拖拽、调整位置、尺寸、分组及连接代币来直观表达各视觉代币间的关系和空间构造。
    • 意图执行机制:基于先进的 AI 模型,如 BoxDiff 和 Style-Align,将用户的视觉词典(visual lexicon)逐步转译为控制信号,并实现最终图像生成。
  • 创新之处

    1. 提出了 以视觉主导的交互范式,使设计师可以直接操控参考图片中的片段,而非整张图片。
    2. 定义了三类关键代币:视觉代币(具体元素)、文本代币(补充文字描述)和想象代币(赋予 AI 生成更多自由度)。
    3. 引入持久和临时代币管理,支持元素的高效复用和迭代设计,这是当前文本提示交互中难以实现的特性。
    4. 改进了视觉表述的可解释性,提升了人-机协作效率,同时扩大了元素构造与重用的灵活性。
  • 实施步骤与关键技术

    1. 代币生成
      • 通过技术(如 SAM 模型和 Break-A-Scene 方法)从参考图像中分割和提取特定的主体、颜色或风格,转化为代币。
      • 提供自动化和手动控制的颜色提取功能、风格传递工具等。
    2. 代币操控
      • 支持 拖拽、移动、大小调整、分组和连接代币,并允许代币之间的交叉引用。
      • 允许代币的视觉构造被反复迭代调整,帮助用户探索不同的设计选择。
    3. 意图执行
      • 使用 BoxDiff 限制 AI 图像生成中的布局控制。
      • 用 Style-Align 同步视觉风格,HistoGAN 调整全局颜色,Blended Latent Diffusion 调整局部颜色。
    4. 提供历史面板和过程分步反馈,支持交互结果的追踪和局部调试。

研究成果

  • 具体成果

    1. 用户体验改进:在实验中,设计师可以通过 Brickify 更高效地表达复杂的设计意图,特别是在元素数量多、构造关系复杂的任务中。
    2. 快递的自身感受(Study 1)显示,用户在“表达清晰性”和“降低心智负担”多个方面的体验明显好于传统文本提示。
    3. 用户评价的创造力支持指数(CSI):Brickify 在支持探索性设计及提供愉悦使用体验方面评分较高。
  • 实验评估

    1. 任务时间分析:Brickify 虽然初始构建耗时略高,但 refinement 阶段时间显著缩短,尤其在复杂设计任务(Hard condition)中。
    2. 外部评分结果:与文本提示相比,Brickify 在元素精确性和呈现位置/色彩等关系方面的清晰度显著更高。
    3. 用户偏好:88%的用户更愿意在未来使用 Brickify。
  • 局限性

    1. Brickify 在需要全新创造(非整合式设计)和高自由表达时表现较弱。
    2. 后端技术(如 AI 模型调用)的高推理成本限制了实时反馈可能性,可能对创作流畅性产生一定影响。
    3. 实验中仅纳入了经验丰富的设计师,结果可能不完全适用于设计新手。
  • 未来方向

    1. 增加更丰富的代币类型,如相机角度和纹理,扩展表达范围。
    2. 支持用户自定义代币类型及再配置功能,为多样化设计需求提供解决方案。
    3. 开发双向可操作的视觉词典提取,让用户和 AI 都可构建可编辑设计元素。
    4. 跨越静态设计,探索 Brickify 的动态视频制作或 3D 场景建模潜力。

总结

Brickify 的提出重新定义了人机协作中“如何更直观高效地表达自我意图”这一核心问题,并为 AI 赋予更可控的输入执行能力。这项工作不仅在界面交互领域具有重要价值,同时为未来探索视觉创意工具设计提供了强有力的理论和实践支持。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188912/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714087
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、平面设计与排版工具、创意协作与反馈系统
work
职业/产业
UI/UX 设计师、产品设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文