G3.16.5ranking incomparability across scopes设计研究

作用域会改变排序结果,不同范围下的靠前结果不可直接比较

别名: 跨范围排名不可比 · collection-relative rank · 作用域改变排序

概念解释

同一查询在「本栏目」里的第一名,不必是「全站」里的第一名,更不必是「更好」的那一条。跨范围的排名不可比:名次是相对于当前候选集的,换了集合,IDF、竞争者和点击先验都变,排位跟着变。把两个范围里的「第一名」并排放、或把局部第一名当成全局质量信号,是在比较两场不同比赛的冠军。

这与「多库合并要统一尺度」是前后两步。统一尺度解决的是同时检索几个范围时怎么排一条列表;不可比说的是分别跑两个范围时,两边的靠前结果不能互相当证据。

机制

排序是一场锦标赛,选手名单由作用域决定。小集合里容易当第一:竞争对手少,稀有词的 IDF 更大,一个中等匹配就能出头。同一文档进到大集合,会碰到更精确、更新、更常被点的对手,名次下滑。人却习惯把「排第一」读成对象的绝对属性,像价格。换范围后第一名变了,会被解释成系统不稳定,或解释成对象本身变了。

局部第一名还被下游误用:推荐「相关文档」、缓存「最佳命中」、把局部冠军提升到全局首页。这些用法把集合相对的名次当成了跨集合的质量。作用域一变,被提升的那条可能在新名单里根本进不了前十。

怎么研究

固定查询与文档,只改候选集的边界,观察名次移动,并测人是否把名次当成绝对质量。

  • 范式:同一查询在嵌套的三层范围上跑,记录目标文档的名次曲线;另设界面把两个范围的「第一名」并排,问哪一条「更相关」。信息检索里 collection size 对 IDF 和排名的影响是已知现象,界面研究要补的是人对名次的绝对化。
  • 自变量:范围大小、是否在 UI 上并排两个范围的顶部结果、是否标注「仅在本范围内的名次」。
  • 因变量:同一文档跨范围的名次差、把局部第一名选为「整体更好」的比例、范围切换后因第一名变化而产生的不信任评分。
  • 方法论注意点:若两个范围的第一名碰巧是同一文档,不可比不会被体验到。要选在局部出头、在全局被压下去的文档。不要用点击率当跨范围的金标准,点击本身也相对于当时看到的名单。

边界

范围几乎一样大、候选高度重叠时,名次会接近,不可比的实际伤害变小,但逻辑上仍相对。人工作在单一范围、从不切换时,名次只在该范围内被消费,不可比不会爆发;一旦产品提供「在全站看」或把局部冠军推到别处,问题出现。展示原始分数会加强绝对化,比展示名次更糟。

怎么落地

  • 不要把「本范围第一名」当成可导出的全局质量,不拿它去填另一范围的推荐或首页。
  • 范围切换后若顶部结果换了,用「在『范围名』中的结果」标明名单换了,不要让人以为同一场比赛重赛。
  • 需要并排比较两个范围时,比的是对象是否出现、属性是否不同,而不是两边的名次数字。
  • 验证:找一篇在子栏目排第一、在全站排到十名以外的文档。切换范围后它应换位。若界面仍把它标成「最佳匹配」而不提范围,或把两个第一名并排让人选「哪个更好」却不说明比赛不同,名次被当成了绝对量。

延伸

  • 同组G3.16.1 默认作用域应取当前上下文,而非默认全局 · G3.16.2 嵌套结构中的作用域可逐级继承,子范围默认包含于父范围 · G3.16.3 窄范围零结果时应提供一键扩大到上级范围的选项 · G3.16.4 多作用域同时检索时,结果合并需要统一的相关性标准
  • 相邻G3.05 结果排序 · G3.12 搜索范围 · G3.17 检索结果的可解释性
  • 站内检索collection-relative ranking · IDF · scope switch

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/G3.16.5