Jigsaw:通过连接AI基础模型支持设计师原型设计多模态应用程序

生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作原型设计与用户测试UI/UX 设计师产品设计师

文献标题

Jigsaw: Supporting Designers to Prototype Multimodal Applications by Assembling AI Foundation Models

文献信息

  • 主题领域: 人机交互、设计与人工智能结合、可视化编程
  • 关键词: 原型制作, 机器学习, 基础模型, 多模态, 可视化编程接口

研究背景与问题

  • 问题与挑战:

    1. 设计师对AI基础模型的全功能了解有限,无法充分利用其潜力。
    2. 编写“AI友好”的提示及调整参数较为繁琐。
    3. 跨平台、多模态模型的集成难度较大。
    4. 原型制作过程缓慢,难以有效地进行快速迭代和实验。
  • 重要性: 随着AI基础模型的快速发展,设计者正在尝试将这些模型集成到创意工作流中,但面临诸多技术与工作流上的障碍。解决该问题将提高设计师的工作效率,并推动AI技术的更广泛应用。

  • 研究动机: 作者旨在通过设计一款工具(Jigsaw),让设计师能够便捷地探索、组合和使用AI基础模型,从而克服上述挑战。

解决方案

  • 提出的方法:

    1. Jigsaw使用拼图块作为基础模型的比喻,每块拼图代表一个功能或模型。
    2. 包括一个“拼图库面板(Catalog Panel)”来展示所有可用模型,并提供模型描述、运行示例和搜索功能。
    3. 利用图块颜色编码和拼接机制,明确模型间的兼容性,简化多模态模型的组合。
    4. 集成“组装助手(Assembly Assistant)”功能,通过自然语言描述推荐模型组合。
    5. 提供中间结果的实时反馈机制,帮助用户在构建和调试过程中快速观察和调整。
  • 创新点:

    1. 基于拼图块的直观可视化界面大幅降低了设计师使用AI的技术门槛。
    2. 集成提示生成和参数解释功能,帮助用户轻松生成有效的AI模型输入。
    3. 跨多模态的无缝模型整合。
    4. 面向非技术设计师的全新块式可视化编程接口。
  • 实施步骤:

    1. 创建了支持文本、图像、视频、3D、音频和草图的模型库,共计39个模型。
    2. 为每个模型设计了特定的输入、输出类型及默认参数。
    3. 实现了基于LLM的“胶水块(glue pieces)”以支持多模型串联任务。
    4. 集成了实时输入和输出面板,支持包括文本、影像和音频在内的多模输入输出形式。

研究成果

  • 具体成果:

    1. 开发了Jigsaw系统,简化了设计师使用基础模型的流程。
    2. 用户可以通过拼图形式构建复杂的基于AI的设计工作流。
    3. 实现了对模型功能的探索、快速原型的设计、以及设计记录的可视化。
  • 与现有解决方案的优势:

    1. 针对非技术性设计师易于上手的块式界面设计。
    2. 能有效指导设计师选择适合的模型并实现模型间的组合。
    3. 支持多模态模型的跨平台合作与快速原型制作。
  • 实验结果:

    • 对十位设计师进行了用户研究,发现Jigsaw能显著帮助设计师:
      1. 探索新的AI能力,通过语义搜索与拼图块提示更深入了解模型。
      2. 快速构建和迭代AI创意工作流。
      3. 在多个任务与模态之间直观地组合模型。
  • 局限性与未来方向:

    1. 目前每类任务仅支持一个AI模型,未来计划扩展多模型选择。
    2. 需要增强组装助手对复杂任务的处理能力,并支持与设计师的交互式迭代。
    3. 将扩展实时视频与音频流输入/输出支持。
    4. 探讨在Jigsaw中集成多模态大型语言模型(MLLM)技术的可能性。
    5. 创建一个设计模板库,便于设计师共享经验与工作流。

总结

Jigsaw通过拼图块形式的可视化设计工具,降低了使用AI基础模型的技术门槛,并扩展了设计师的创意空间。研究验证了该工具对非技术背景设计师的有效性,并指出未来可能的改进方向。Jigsaw的成功展示了可视化编程理念在设计与AI结合中的显著潜力,为相关研究与应用打开了新的大门。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/147352/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3641920
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、原型设计与用户测试
work
职业/产业
UI/UX 设计师、产品设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文