G3.15.2cluster similar-not-same results设计研究

高度相似但不完全相同的结果应分组呈现,而非并列展示

别名: 检索结果聚类 · similar result grouping · Scatter/Gather

概念解释

十个结果说的几乎是同一件事,却仍是十个可分开选择的对象:同一书的精装与平装、同一型号的不同颜色、同一事件的现场报道与评论。它们不该被合成一条代表项,也不该在列表里做成十行几乎相同的摘要。相似项分组(grouping similar-but-not-same results)把它们收成一组,占一行的位置,组内仍是不同选项。Hearst 与 Pedersen 的 Scatter/Gather、后来的检索结果聚类,针对的就是这种「像、但还要选」的集合。

并列展示的失败是视觉上的假重复:人以为去重没做,于是跳过整段。合成一条的失败是真选择被删掉。分组走中间:少占行,不删选项。

机制

高度相似的摘要共享气味。连续多行气味几乎不变,人会启动「已经看过」的跳过,后面几行即使有关键差异(有货、更短、官方)也被当成复制品滑过去。分组把「这一簇」标成一个比较单元,差异被预期为组内问题,而不是下一行碰巧不一样。工作记忆从「又一篇类似的」转成「这里有几个版本」。

不分组的并列还会扭曲排序观感:相关性分数接近的相似文档会连成一块地盘,把真正不同的对象挤出首屏。分组按簇占位,多样性发生在簇与簇之间,相似造成的垄断被拆掉。

怎么研究

对照「全展开并列」「合成一条」「按相似分组」三种呈现,看人是否还找得到组内那一个不同的选项,以及是否跳过整块。

  • 范式:同一结果集,三种 UI;任务指定一个只存在于相似簇内部的属性(「要平装」「要有货的那个颜色」)。聚类质量用检索结果聚类的标准指标(如簇纯度、与人工主题的一致性),界面效果用任务。
  • 自变量:分组与否、簇的相似度阈值、每组默认露出几条。
  • 因变量:组内目标的发现率、误把整簇当重复而跳过的比例、首屏上不同主题的簇数。
  • 方法论注意点:若任务目标碰巧是簇的代表项,分组和合体会看起来一样好。要把目标放在非代表的组员上。自动聚类的簇若与用户主题不对齐,测到的是聚类失败,不是分组这种呈现形式失败。

边界

簇内对象对当前任务完全可互换时,分组是多余的仪式,合为一条更干净。相似度过低的强制分组会把不相关的东西捆在一起,人会以为系统在主张它们等价。图像、地图、时间线等已经有空间或时间轴的结果,再按文本相似分组会和已有维度打架。专家对比任务(并排看两份合同)需要并列,分组会挡开比较。

怎么落地

  • 对「像但不等于」的结果按相似收组,一组占一行,标题写共同之处,不要把十个近义摘要排成十行。
  • 阈值宁可比近重复检测松,但松到仍能回答「它们还需要分开选吗」;不需要选的,交给同一性合并。
  • 默认露出代表一条加「还有 N 个相似结果」,而不是默认全部展开。
  • 验证:构造一个前十里有六条近义新闻加一条真正不同的文档的查询。分组后首屏应能看见那条不同的,且六条新闻不再各占一行。若六条仍并列,或那条不同的被捆进新闻组,分组没有对准「像、但还要选」。

延伸

  • 同组G3.15.1 同一实体的多来源结果需去重合并,只呈现一条代表项 · G3.15.3 分组会隐藏组内差异,需提供入口展开查看全部选项 · G3.15.4 去重判定标准需让用户可理解,避免已知结果无故"消失" · G3.15.5 分组维度应对齐用户决策维度,而非数据库内部字段
  • 相邻G3.05 结果排序 · G3.06 结果摘要 · G1.02 组织体系
  • 站内检索search result clustering · Scatter/Gather · similar results

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/G3.15.2