图像搜索的当代艺术:基于视觉-语言模型的迭代式用户意图扩展

图像搜索是探索大量数字图像的基本且用户友好的方法。然而,现有图像搜索方法严重依赖标签匹配或图像相似性等邻近度测量,需要精确的用户输入才能获得满意结果。为了满足对当代图像搜索引擎日益增长的需求,准确理解用户的搜索意图,我们引入了一个创新的用户意图扩展框架。我们的框架利用视觉-语言模型解析和组合多模态用户输入,以提供更准确和满意的结果。框架包含两个阶段:1) 解析阶段,结合大型语言模型的语言解析模块增强对文本输入的理解,以及整合交互式分割模块的视觉解析模块,以快速识别图像中的详细视觉元素;2) 逻辑组合阶段,将多个用户搜索意图组合成统一的逻辑表达式,以便在复杂搜索场景中进行更复杂的操作。此外,意图扩展框架使用户能够与搜索结果进行灵活的上下文交互,以迭代地进一步指定或调整其详细搜索意图。我们将该框架实现为NFT(非同质化代币)搜索的图像搜索系统,并进行用户研究以评估其可用性和新特性。结果表明,所提出的框架显著改善了用户的图像搜索体验,特别是解析和上下文交互功能在帮助用户更准确地表达搜索意图和享受更愉悦的迭代搜索体验方面效果显著。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/cscw/180053/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3641019
一眼看懂

论文快照

fact_check
dataset
来源
CSCW
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
work
职业/产业
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文