高度相似但不完全相同的结果应分组呈现,而非并列展示
别名: 检索结果聚类 · similar result grouping · Scatter/Gather
概念解释
十个结果说的几乎是同一件事,却仍是十个可分开选择的对象:同一书的精装与平装、同一型号的不同颜色、同一事件的现场报道与评论。它们不该被合成一条代表项,也不该在列表里做成十行几乎相同的摘要。相似项分组(grouping similar-but-not-same results)把它们收成一组,占一行的位置,组内仍是不同选项。Hearst 与 Pedersen 的 Scatter/Gather、后来的检索结果聚类,针对的就是这种「像、但还要选」的集合。
并列展示的失败是视觉上的假重复:人以为去重没做,于是跳过整段。合成一条的失败是真选择被删掉。分组走中间:少占行,不删选项。
机制
高度相似的摘要共享气味。连续多行气味几乎不变,人会启动「已经看过」的跳过,后面几行即使有关键差异(有货、更短、官方)也被当成复制品滑过去。分组把「这一簇」标成一个比较单元,差异被预期为组内问题,而不是下一行碰巧不一样。工作记忆从「又一篇类似的」转成「这里有几个版本」。
不分组的并列还会扭曲排序观感:相关性分数接近的相似文档会连成一块地盘,把真正不同的对象挤出首屏。分组按簇占位,多样性发生在簇与簇之间,相似造成的垄断被拆掉。
怎么研究
对照「全展开并列」「合成一条」「按相似分组」三种呈现,看人是否还找得到组内那一个不同的选项,以及是否跳过整块。
- 范式:同一结果集,三种 UI;任务指定一个只存在于相似簇内部的属性(「要平装」「要有货的那个颜色」)。聚类质量用检索结果聚类的标准指标(如簇纯度、与人工主题的一致性),界面效果用任务。
- 自变量:分组与否、簇的相似度阈值、每组默认露出几条。
- 因变量:组内目标的发现率、误把整簇当重复而跳过的比例、首屏上不同主题的簇数。
- 方法论注意点:若任务目标碰巧是簇的代表项,分组和合体会看起来一样好。要把目标放在非代表的组员上。自动聚类的簇若与用户主题不对齐,测到的是聚类失败,不是分组这种呈现形式失败。
边界
簇内对象对当前任务完全可互换时,分组是多余的仪式,合为一条更干净。相似度过低的强制分组会把不相关的东西捆在一起,人会以为系统在主张它们等价。图像、地图、时间线等已经有空间或时间轴的结果,再按文本相似分组会和已有维度打架。专家对比任务(并排看两份合同)需要并列,分组会挡开比较。
怎么落地
- 对「像但不等于」的结果按相似收组,一组占一行,标题写共同之处,不要把十个近义摘要排成十行。
- 阈值宁可比近重复检测松,但松到仍能回答「它们还需要分开选吗」;不需要选的,交给同一性合并。
- 默认露出代表一条加「还有 N 个相似结果」,而不是默认全部展开。
- 验证:构造一个前十里有六条近义新闻加一条真正不同的文档的查询。分组后首屏应能看见那条不同的,且六条新闻不再各占一行。若六条仍并列,或那条不同的被捆进新闻组,分组没有对准「像、但还要选」。