BloomIntent:使用LLM生成的细粒度用户意图自动化搜索评估
作者
如果100个人发出相同的搜索查询,他们可能有100个不同的目标。虽然现有以用户为中心的AI评估工作强调将系统与细粒度用户意图对齐的重要性,但当前搜索评估方法难以表示和评估这种多样性。我们引入了BloomIntent,这是一种以用户为中心的搜索评估方法,使用用户意图作为评估单元。BloomIntent首先基于用户属性和信息寻求意图类型的分类法生成一组看似合理的细粒度搜索意图。然后,BloomIntent提供由大型语言模型驱动的针对每个意图的搜索结果自动化评估。为支持实际分析,BloomIntent对语义相似的意图进行聚类,并在结构化界面中总结评估结果。通过三项技术评估,我们表明BloomIntent生成了细粒度、可评估且现实的意图,并产生了可扩展的意图级满意度评估,与专家评估者达成72%的一致性。在案例研究(N=4)中,我们展示了BloomIntent帮助搜索专家识别模糊查询的意图,发现未满足的用户需求,并发现改善搜索体验的可操作见解。通过从查询级转向意图级评估,BloomIntent重新構想了搜索系统的评估方式——不仅评估性能,还评估其服务众多用户目标的能力。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 63%
并非越多越好:在多AI建议中平衡决策准确性与从众压力
CHI '26· 大语言模型(LLM)的人机协作 +2
- 63%
感知问卷遗漏之处:通过用户建模理解并个性化主动式LLM支持
CHI '26· 大语言模型(LLM)的人机协作 +2
- 63%
多任务人机交互中的信念更新与委托:以受控模拟为证据
CHI '26· 大语言模型(LLM)的人机协作 +2
- 63%
多智能体议价中人与人工智能的战略权衡
IUI '26· 大语言模型(LLM)的人机协作 +2
- 63%
使智能摘要界面中的缺失可见
IUI '26· 大语言模型(LLM)的人机协作 +2
- 63%
“非默认”行为调整:利用大语言模型自播和自改进指定规范外模型行为
IUI '26· 大语言模型(LLM)的人机协作 +2
- 63%
OntoScope:利用发散-收敛交互框架支持基于 LLM 的本体论范围界定
IUI '26· 大语言模型(LLM)的人机协作 +2
- 63%
LLM 输出对启发式诱导提示结构的脆弱性
IUI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)