GenQuery: 使用生成模型支持表达性的视觉搜索

生成式AI(文本、图像、音乐、视频)推荐系统用户体验UI/UX 设计师产品设计师

文献标题

GenQuery: Supporting Expressive Visual Search with Generative Models

文献信息

  • 主题领域: 设计领域的可视化搜索与生成式模型的结合
  • 关键词: 可视化搜索, 生成式模型, 创造力支持, 搜索意图表达, 设计工具, 用户研究

研究背景与问题

  • 发现的问题与挑战:

    • 在设计早期阶段,设计师很难将抽象的设计意图转化为具体的搜索关键词。
    • 基于现有工具的图像搜索受限于设计工具对图像整体相似性的评估,用户难以聚焦于细粒度的设计元素。
    • 当前的搜索方法无法有效支持发散性思维的探索,不易发现多样化的创意。
  • 为什么这个问题重要:

    • 可视化搜索是设计早期阶段的重要组成部分。帮助设计师更高效地表达和执行搜索意图,可以显著提升创意生成与设计探索的质量。
  • 研究动机与相关工作:

    • 当前研究主要聚焦于丰富搜索模式,例如通过自然语言和图像的结合进行搜索,也提出了一些强调多样性设计推荐的方法。
    • 生成式模型在个性化创意支持领域已显现出潜力,文本-图像模型可以从简单关键词生成高质量图像;生成式语言模型可以扩展用户意图。
    • 本研究将生成式模型作为中间层,探索其在可视化搜索中的潜力。

解决方案

  • 提出的方法与解决方案:

    • GenQuery系统旨在将生成式模型集成到可视化搜索中,提供三种核心功能:
      1. 查询具体化:通过建议具体搜索关键词扩展用户的模糊查询。
      2. 基于图像的图像修改:选择图像中的某一区域并替换为参考图像中的内容,从而生成符合意图的图像。
      3. 基于关键词的图像修改:结合用户搜索历史生成关键词,修改图像并生成新的搜索方向。
  • 创新之处:

    • 将生成式模型整合为搜索过程的中间层,让生成的图像既能表达意图,也能作为进一步搜索的起点。
    • 运用生成的不确定性促进发散式思维,帮助用户探索更多创意。
  • 实施步骤与关键技术:

    • 技术架构:
      1. 使用GPT-3.5生成具体化搜索建议。
      2. 利用Segment Anything和PaintByExample模型实现图像区域选择与替换生成。
      3. 通过关键词与Kandinsky2.2扩散模型实现关键词指导的图像生成。
    • 系统界面:分为文本输入框、图像搜索展示、生成/edit功能按钮。
    • 用户可通过交互预览具体化建议或关键词,并基于生成的结果开展探索。

研究成果

  • 具体成果:

    • 比较研究表明,16名设计师在使用GenQuery时能够更准确地表达搜索意图,并发现更多满意结果。
    • 与传统工具相比,设计师使用基于生成特性的搜索减少了71.2%的文本搜索频率,约35.8%的被保存设计通过生成搜索获得。
    • GenQuery显著提升了结果的多样性和创意性,用户满意度高。
  • 与现有解决方案的优势:

    • 支持用户以图像修改和关键词推荐的方式表达复杂的搜索意图。
    • 通过生成过程揭示多样化设计方向,相比传统搜索工具更能激发发散性探索。
  • 实验与评估结果:

    • 实验显示,GenQuery帮助用户减少了重复搜索行为,同时通过生成式搜索模式找到更多契合意图的结果。
    • 尽管生成式模型输出偶有无法完全匹配用户需求的情况,参与者在多数情况下依旧表示受益于其意外探索路径。
  • 局限性与未来方向:

    • 局限性:
      1. 生成输出缺乏精细控制,用户在具体意图下可能陷入重复生成循环。
      2. 数据集限制可能导致生成图像相关搜索结果不足。
      3. 图像区域选择工具的模块仍需优化,支持用户更精准的选择。
    • 未来方向:
      1. 根据用户意图具体化程度调整生成模型的控制水平。
      2. 集成用户行为数据改进生成结果推荐。
      3. 扩展模型支持,进一步探索生成过程在设计原型阶段的应用。

总结

本文证明了生成式模型在丰富可视化搜索工具中的潜力。通过整合生成和搜索两种功能,GenQuery支持设计师在早期创意阶段更高效地表达复杂意图,激发更多创意设计可能性,同时提出了对生成模型输出控制和改善的设计建议,为未来相关工具的开发提供了重要参考。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/148274/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642847
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、推荐系统用户体验
work
职业/产业
UI/UX 设计师、产品设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文