Jigsaw:通过连接AI基础模型支持设计师原型设计多模态应用程序
文献标题
Jigsaw: Supporting Designers to Prototype Multimodal Applications by Assembling AI Foundation Models
文献信息
- 主题领域: 人机交互、设计与人工智能结合、可视化编程
- 关键词: 原型制作, 机器学习, 基础模型, 多模态, 可视化编程接口
研究背景与问题
-
问题与挑战:
- 设计师对AI基础模型的全功能了解有限,无法充分利用其潜力。
- 编写“AI友好”的提示及调整参数较为繁琐。
- 跨平台、多模态模型的集成难度较大。
- 原型制作过程缓慢,难以有效地进行快速迭代和实验。
-
重要性: 随着AI基础模型的快速发展,设计者正在尝试将这些模型集成到创意工作流中,但面临诸多技术与工作流上的障碍。解决该问题将提高设计师的工作效率,并推动AI技术的更广泛应用。
-
研究动机: 作者旨在通过设计一款工具(Jigsaw),让设计师能够便捷地探索、组合和使用AI基础模型,从而克服上述挑战。
解决方案
-
提出的方法:
- Jigsaw使用拼图块作为基础模型的比喻,每块拼图代表一个功能或模型。
- 包括一个“拼图库面板(Catalog Panel)”来展示所有可用模型,并提供模型描述、运行示例和搜索功能。
- 利用图块颜色编码和拼接机制,明确模型间的兼容性,简化多模态模型的组合。
- 集成“组装助手(Assembly Assistant)”功能,通过自然语言描述推荐模型组合。
- 提供中间结果的实时反馈机制,帮助用户在构建和调试过程中快速观察和调整。
-
创新点:
- 基于拼图块的直观可视化界面大幅降低了设计师使用AI的技术门槛。
- 集成提示生成和参数解释功能,帮助用户轻松生成有效的AI模型输入。
- 跨多模态的无缝模型整合。
- 面向非技术设计师的全新块式可视化编程接口。
-
实施步骤:
- 创建了支持文本、图像、视频、3D、音频和草图的模型库,共计39个模型。
- 为每个模型设计了特定的输入、输出类型及默认参数。
- 实现了基于LLM的“胶水块(glue pieces)”以支持多模型串联任务。
- 集成了实时输入和输出面板,支持包括文本、影像和音频在内的多模输入输出形式。
研究成果
-
具体成果:
- 开发了Jigsaw系统,简化了设计师使用基础模型的流程。
- 用户可以通过拼图形式构建复杂的基于AI的设计工作流。
- 实现了对模型功能的探索、快速原型的设计、以及设计记录的可视化。
-
与现有解决方案的优势:
- 针对非技术性设计师易于上手的块式界面设计。
- 能有效指导设计师选择适合的模型并实现模型间的组合。
- 支持多模态模型的跨平台合作与快速原型制作。
-
实验结果:
- 对十位设计师进行了用户研究,发现Jigsaw能显著帮助设计师:
- 探索新的AI能力,通过语义搜索与拼图块提示更深入了解模型。
- 快速构建和迭代AI创意工作流。
- 在多个任务与模态之间直观地组合模型。
- 对十位设计师进行了用户研究,发现Jigsaw能显著帮助设计师:
-
局限性与未来方向:
- 目前每类任务仅支持一个AI模型,未来计划扩展多模型选择。
- 需要增强组装助手对复杂任务的处理能力,并支持与设计师的交互式迭代。
- 将扩展实时视频与音频流输入/输出支持。
- 探讨在Jigsaw中集成多模态大型语言模型(MLLM)技术的可能性。
- 创建一个设计模板库,便于设计师共享经验与工作流。
总结
Jigsaw通过拼图块形式的可视化设计工具,降低了使用AI基础模型的技术门槛,并扩展了设计师的创意空间。研究验证了该工具对非技术背景设计师的有效性,并指出未来可能的改进方向。Jigsaw的成功展示了可视化编程理念在设计与AI结合中的显著潜力,为相关研究与应用打开了新的大门。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 设计师如何通过视觉化工具高效探索、组合和利用AI基础模型?分类: 创作工作流与多阶段流程同类问题arrow_forward
- 拼图式界面能否降低非技术设计师使用多模态AI模型的技术门槛?分类: 创作工作流与多阶段流程同类问题arrow_forward
- 如何帮助设计师进行快速的AI创意工作流构建与迭代?分类: 创作工作流与多阶段流程同类问题arrow_forward
现实痛点
1- 设计师难以快速构建和迭代基于多模态AI的设计工作流。分类: 创作工作流与多阶段流程同类问题arrow_forward
- 100%
GenTune:面向可追溯提示词以提升环境设计中图像细化的可控性
UIST '25· 生成式AI(文本、图像、音乐、视频) +2
- 80%
探索支持设计师学习与基于AI的制造设计工具协同创造的挑战与机遇
CHI '23· 生成式AI(文本、图像、音乐、视频) +1
- 80%
人工智能辅助的人因设计因果路径图
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 80%
I-Card:一种由生成式AI支持的智能设计方法卡片集
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 80%
与人工智能设计构思——生成式机器学习模型的素描、思考与对话
DIS '23· 生成式AI(文本、图像、音乐、视频) +1
- 80%
PromptInfuser:AI与UI设计的紧密耦合如何影响设计师的工作流程
DIS '24· 大语言模型(LLM)的人机协作 +1
- 67%
可以使用AI吗?使用合作上下文强盗进行设计构思
CHI '19· 生成式AI(文本、图像、音乐、视频) +2
- 67%
ICONATE:自动复合图标生成与构思
CHI '20· 生成式AI(文本、图像、音乐、视频) +2
- 67%
PlantoGraphy:将迭代设计过程融入景观渲染的生成式人工智能
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 67%
IEDS: 探索结合设计师、AR和GAI的智能实体设计空间以支持工业概念设计
CHI '25· AR 导航与情境感知 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)