L6.09.5logging-policy bias in offline evaluation设计研究

用历史日志做离线评估会系统性偏向产生这些日志的现有策略

别名: 离线评估偏差 · 日志政策偏向 · off-policy bias

概念解释

拿上周的展示与点击,计算新模型的召回、精确率、nDCG,分数高的往往是「更像上周那个排序器」的模型。离线评估对日志政策的偏向(logging-policy bias in offline evaluation)指:历史日志里的正例是现有策略曝光出来的,离线指标奖励的是复现该策略,惩罚的是把曝光分给日志里看不见的条目——即便那些条目在线上会更好。

曝光偏差说正例条件于展示。这里说的是评价器吃了同一份条件数据,会把新政策错判。

机制

离线协议假设:日志里的点击是对条目质量的标签,可以在任意新排序上重放。但点击只在旧排序的展示集上被观测。新政策若把旧政策没展示过的条目提前,日志给不出正例,nDCG 当它错;新政策若把旧头部再往前推,正例齐活,nDCG 当它对。于是「更好的利用」被奖励,「必要的探索」被惩罚。

逆倾向加权、双稳健估计、交错实验,是为了把评价从日志政策上揭下来。不走这些,只报离线表,产品会系统性地拒绝打开回路的模型,不是因为它们线上差,因为它们在自己的日志里看起来差。

怎么研究

推荐系统评价的方法对照:同一批候选模型,分别用纯离线 nDCG、IPS / 双稳健、线上交错或 A/B。看三种排序是否一致,尤其是探索型、多样型模型在离线上的名次。自变量:日志是否含随机探测、倾向分是否校准。因变量:离线名次与线上名次的肯德尔相关、探索型模型被离线错杀的比例。

没有探测槽的日志,IPS 也会高方差。要报倾向分的重叠,不要只报一个加权分数。方法描述到此为止——不要编造「某论文提高了百分之几」。

边界

候选集被旧政策完全覆盖(近乎轮播的小库)时,离线偏向轻。纯内容检索、与展示政策无关的任务,离线更站得住。这条管「用自己的展示日志评自己会偏向自己」,不处理用户演戏,也不把探索的体验成本再讲一遍。

怎么落地

  • 离线表不得单独决定上线。探索型、多样型改动必须走交错或小流量线上,哪怕离线分数掉。
  • 日志里保留倾向分和是否探测的标记,评测默认用反事实方法,并把纯 nDCG 只当诊断。
  • 验证:拿一个已知在线上覆盖更好、点击略掉的多样模型,看它在纯离线表上的名次。若它沉底而「更像旧政策」的模型垫顶,离线评估已经在为回路站台。把同一模型放到交错里复验。

延伸

  • 同组L6.09.1 系统只能观察被展示过的内容,未被展示的项永远得不到正反馈 · L6.09.2 早期的偶然点击会被放大成长期稳定的画像特征 · L6.09.3 用户为获得想要的推荐而调整行为,行为数据因此失去代表性 · L6.09.4 打破回路需要主动探索,而探索的成本立即可见、收益延后
  • 相邻L6.04 反馈回路 · L6.08 过滤气泡与多样性 · L6.02 过滤气泡
  • 站内检索offline evaluation bias · logging policy · off-policy evaluation

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L6.09.5