G3.17.4do not show raw relevance scores设计研究

内部相关性分数不适合直接展示给最终用户

别名: 相关性分数 · BM25 展示 · 内部打分

概念解释

BM25、余弦、学习排序的 logit、弹性分——这些数是给打分器调试用的,不是给查找用的。不向最终用户展示原始相关性分数,因为这个数没有稳定的含义:同一文档换一条查询、换一个范围、换一次模型版本,数字可以跳一个数量级,人却会把它读成「匹配了百分之多少」。可解释性需要的是可行动的理由(打中了哪个字段、用了哪条过滤),不是假精确的小数。

调试模式、内部工具可以把分数留下来。那是另一类用户、另一份界面,不能混进公众结果页。

机制

分数是相对量。没有单位、没有满分、不可跨查询比较,却长得像测量值。人一旦看见 87.3 对 12.1,就会发明「差很多」的故事,即使两个数只是同一名单里的排序代号。后续行为跟着故事走:丢掉 12.1 的那条(可能仍相关)、追逐 87.3(可能只是字段膨胀)、甚至改查询去「刷分」。解释本应支持改写查询,分数却把注意力吸到优化一个没有外部指称的数字上。

分数还会过时而不自知。模型一换,同一对查询–文档的数变了,收藏「高分结果」的人会以为内容变了。名次已经够容易被绝对化;把内部浮点写出来是给绝对化提供了更细的刻度。

怎么研究

比较「只给名单」「给名次」「给原始分」三种展示对解释质量和查询改写的影响。

  • 范式:同一结果集,三种标注;问「这两条差在哪」「下一步你改查询的哪一部分」,以及是否出现「刷分」行为。信息检索的用户研究里,展示内部分通常不提高相关性判断,有时还降低。专家(评估人员、搜维工程师)应分开招募,不要和最终用户混在同一分析里。
  • 自变量:展示形式(无 / 名次 / 原始分 / 归一化百分位)、分数是否跨查询保持。
  • 因变量:对相对质量的判断是否与金标准同向、改写是否指向查询词而非分数、把分数差解释成「差百分之几」的比例。
  • 方法论注意点:评估人员已经学会忽略分数的绝对含义,用他们当被试会低估伤害。要用偶发用户。百分位比原始分稍好,仍会被读成「匹配度百分比」,不能当作已经解决。

边界

相关性评估工具、TREC 式标注界面、搜维调试台的用户就是来看分数的,不展示会挡工作;那是工作台,要有权限墙,不能当产品默认。需要向监管说明「为什么这条在前」时,分数可以进审计日志,不必进结果行。游戏化排行(公开贡献榜)用的不是检索相关性分,不要混为一谈。把分数映射成三五档「很相关 / 有点相关」仍然在展示内部判断,只是降低了假精确,不能替代字段和过滤那样的可行动解释。

怎么落地

  • 公众结果页不渲染 BM25、模型分或百分比匹配。调试分放进仅内部可见的面板。
  • 解释用字段、来源、已应用约束、时间等有外部指称的属性,不用「得分 73」。
  • 若业务坚持要「匹配度」,最多用与名单相对的粗档,并写明「仅表示在本次结果中的相对位置」。
  • 验证:给未参与设计的人看带原始分的结果页,问两条分数差意味着什么。若答案是「这条匹配了百分之八十、那条只有二十」或开始改查询去抬分数,分数已经在误导。去掉分数后,同样的人应改去谈字段和内容是否对题。

延伸

  • 同组G3.17.1 结果需标明匹配发生在标题、正文还是标签等具体字段 · G3.17.2 个性化排序的结果需提示这是定制结果而非通用结果 · G3.17.3 系统隐式施加的过滤条件需要向用户说明来源 · G3.17.5 可解释性的目的是帮助用户调整查询,而非证明排序正确
  • 相邻G3.05 结果排序 · G3.06 结果摘要 · T2.04 错误文案
  • 站内检索relevance score · BM25 · search explainability

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/G3.17.4