Brickify:通过设计令牌上的直接操作启用表达设计意图规范
生成式AI(文本、图像、音乐、视频)平面设计与排版工具创意协作与反馈系统UI/UX 设计师产品设计师
研究背景与问题
-
发现问题和挑战:
- 当前通过自然语言提示(如文本)表达设计意图的方式存在困难,设计师需要压缩并准确表达模糊的视觉细节,但这一过程对设计师而言既繁琐又不够直观。
- AI 工具(如 DALL·E、MidJourney)虽然生成 aesthetics 图像表现优秀,但缺乏设计师所需的元素控制能力、尤其是在复杂设计任务中无法清晰表达“元素之间的关系”和细化多轮交互。
- 现有工具中,仅借助文本描述构建复杂的视觉描述时,不仅语言在表达连续属性(如大小、空间位置)方面过于离散,且人工多次输入(如参考图像的重新表述)也耗费大量精力。
-
研究重要性:
- 设计师不仅要求生成高质量结果,还需在设计决策过程中保持对元素的控制,特别是在一些需要多个元素相互关系明确的专业设计场景中。
- 通过视觉方式(而非文本)表达设计语言,可能更贴近设计师的思维模型,降低交流负担。
- 帮助实现 AI 和人类的高效协作,使 AI 更好理解设计师意图。
-
研究动机与相关工作:
- 当前工具的不足主要在于其线性、自上而下的表达方式无法准确支持复杂视觉疑问的译解。
- 相关领域开发了“分步骤文本提示”(modular prompting)、跨模态提升的语义理解工具和视觉直接操控工具,但它们仍在“元素如何构建为整体”这一方面制约明显。
- 因此需要一种新的视觉驱动交互范式,使视觉和交互的表达意图更加丰富与灵活。
解决方案
-
方法解析: 作者提出了一种名为 Brickify 的视觉驱动交互范式,强调“直接操作设计代币”(direct manipulation on design tokens)的方式,帮助用户明确表达需要的设计元素及其关系。
- 设计代币(Design Tokens):将视觉元素(如主体、颜色、风格等)明确化为交互图形化表示对象。
- 设计意图的建构与操作:用户通过拖拽、调整位置、尺寸、分组及连接代币来直观表达各视觉代币间的关系和空间构造。
- 意图执行机制:基于先进的 AI 模型,如 BoxDiff 和 Style-Align,将用户的视觉词典(visual lexicon)逐步转译为控制信号,并实现最终图像生成。
-
创新之处:
- 提出了 以视觉主导的交互范式,使设计师可以直接操控参考图片中的片段,而非整张图片。
- 定义了三类关键代币:视觉代币(具体元素)、文本代币(补充文字描述)和想象代币(赋予 AI 生成更多自由度)。
- 引入持久和临时代币管理,支持元素的高效复用和迭代设计,这是当前文本提示交互中难以实现的特性。
- 改进了视觉表述的可解释性,提升了人-机协作效率,同时扩大了元素构造与重用的灵活性。
-
实施步骤与关键技术:
- 代币生成:
- 通过技术(如 SAM 模型和 Break-A-Scene 方法)从参考图像中分割和提取特定的主体、颜色或风格,转化为代币。
- 提供自动化和手动控制的颜色提取功能、风格传递工具等。
- 代币操控:
- 支持 拖拽、移动、大小调整、分组和连接代币,并允许代币之间的交叉引用。
- 允许代币的视觉构造被反复迭代调整,帮助用户探索不同的设计选择。
- 意图执行:
- 使用 BoxDiff 限制 AI 图像生成中的布局控制。
- 用 Style-Align 同步视觉风格,HistoGAN 调整全局颜色,Blended Latent Diffusion 调整局部颜色。
- 提供历史面板和过程分步反馈,支持交互结果的追踪和局部调试。
- 代币生成:
研究成果
-
具体成果:
- 用户体验改进:在实验中,设计师可以通过 Brickify 更高效地表达复杂的设计意图,特别是在元素数量多、构造关系复杂的任务中。
- 快递的自身感受(Study 1)显示,用户在“表达清晰性”和“降低心智负担”多个方面的体验明显好于传统文本提示。
- 用户评价的创造力支持指数(CSI):Brickify 在支持探索性设计及提供愉悦使用体验方面评分较高。
-
实验评估:
- 任务时间分析:Brickify 虽然初始构建耗时略高,但 refinement 阶段时间显著缩短,尤其在复杂设计任务(Hard condition)中。
- 外部评分结果:与文本提示相比,Brickify 在元素精确性和呈现位置/色彩等关系方面的清晰度显著更高。
- 用户偏好:88%的用户更愿意在未来使用 Brickify。
-
局限性:
- Brickify 在需要全新创造(非整合式设计)和高自由表达时表现较弱。
- 后端技术(如 AI 模型调用)的高推理成本限制了实时反馈可能性,可能对创作流畅性产生一定影响。
- 实验中仅纳入了经验丰富的设计师,结果可能不完全适用于设计新手。
-
未来方向:
- 增加更丰富的代币类型,如相机角度和纹理,扩展表达范围。
- 支持用户自定义代币类型及再配置功能,为多样化设计需求提供解决方案。
- 开发双向可操作的视觉词典提取,让用户和 AI 都可构建可编辑设计元素。
- 跨越静态设计,探索 Brickify 的动态视频制作或 3D 场景建模潜力。
总结
Brickify 的提出重新定义了人机协作中“如何更直观高效地表达自我意图”这一核心问题,并为 AI 赋予更可控的输入执行能力。这项工作不仅在界面交互领域具有重要价值,同时为未来探索视觉创意工具设计提供了强有力的理论和实践支持。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何通过视觉驱动的交互范式更直观和高效地表达设计意图?分类: AI/LLM 作为设计协作者与创意工具同类问题arrow_forward
- 视觉代币系统能否比文本提示更明确地表达元素关系和空间结构?分类: AI/LLM 作为设计协作者与创意工具同类问题arrow_forward
- AI能否通过用户操控的视觉代币更好地理解设计师的意图并生成高质量输出?分类: AI/LLM 作为设计协作者与创意工具同类问题arrow_forward
lightbulb
现实痛点
1- 设计师使用文本提示表达细致设计意图困难且耗时。分类: AI/LLM 作为设计协作者与创意工具同类问题arrow_forward
- 100%
CreativeConnect: 利用生成式人工智能支持图形设计构思中的参考重组
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 83%
FashionQ:一种促进时尚设计创意构思的人工智能驱动支持工具
CHI '21· 生成式AI(文本、图像、音乐、视频) +2
- 83%
利用生成式AI打造创意专长:图形界面在设计空间探索中比文本提示更好地支持创意构思
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 83%
探索用于抽象驱动的探索性图像着色的交互式颜色调板
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 83%
来自惊喜的创造力:弥合时装设计师灵感工作与AI创意支持工具的差距
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 83%
DesignTrace:利用GenAI探索、迭代和追踪设计备选方案
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 83%
DesignPrompt:利用多模态交互进行生成式AI设计探索
DIS '24· 生成式AI(文本、图像、音乐、视频) +2
- 83%
利用涂鸦和注释增强生成式人工智能图像细化:多模态提示的比较研究
IUI '26· 生成式AI(文本、图像、音乐、视频) +2
- 80%
VisiBlends:一种灵活的视觉融合工作流程
CHI '19· 平面设计与排版工具 +1
- 80%
从少量示例中学习个人风格
DIS '21· 生成式AI(文本、图像、音乐、视频) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714087
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、平面设计与排版工具、创意协作与反馈系统
work
职业/产业
UI/UX 设计师、产品设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文