随机注入与结构化多样是两回事,前者只增加噪声
别名: 随机注入 · 结构化多样 · MMR vs shuffle
概念解释
从目录里随便抽几条塞进首页,平均相似度会下降,用户看见的却常常是「这是错的」。随机对结构化多样(random versus structured diversity)指:无结构的注入只提高噪声;多样要的是在选定维度上有计划地铺开——不同作者、不同观点、未覆盖的类——用最大边缘相关、行列式点过程、配额槽一类方法,而不是洗牌。
多样被设计进目标之后,还要决定设计的是哪一种。洗牌不是一种。
机制
随机从全量里抽,抽到的是头部品和完全不相关的尾的混合物。头部品不增加覆盖,尾被读成故障。结构化方法先指定维度,再在该维上最大化间距或填满配额,注入的是「这个维上你还没看见的合法点」,不是任意点。
噪声会污染对多样的评价:用户把故障记在「多样」头上,产品就退回纯相关。随机还有一个统计问题:期望覆盖提升极慢,方差却很大,短窗口的线上实验会判它有害。结构化配额在同样的位置预算下覆盖更稳。
探索–利用里的 epsilon 随机是为了给未展示项一个被点的机会,目的是估计,不是给用户看一份有意义的菜单。把 epsilon 槽直接当多样体验,是把估计器界面化了。
怎么研究
三种注入:均匀随机、按热门偏置的随机、结构化(配额或 MMR 一类)。位置预算相同。测:类目/作者/观点覆盖、把注入项判成出错的比例、短期点击、用户能否说出「系统在让我看不同的 X」。自变量:维度是否被指定、是否可见标记。因变量:覆盖效率(每占一个位置换来的新类)、故障误判。
不要用组内嵌入距离单独当成功。随机也能拉开嵌入距离。要看拉开的是不是事先写下的那个维,以及人认不认。
边界
冷启动探测、广告填充、版权下架后的补位,随机有时是唯一还剩的办法,应标明「随便看看」而不是「发现」。物品极少时,结构化排不满配额,会退化成接近随机。这条区分两种注入,不讨论必须付多少点击,也不讨论维该怎么选。
怎么落地
- 多样槽写明维度和填充规则,禁止「从目录随机抽 N 条」作为发现轨的实现。
- 探测用的随机槽与给用户看的多样槽分开:探测可以不解释,多样槽要让人说得出「不同在哪」。
- 验证:对比随机轨和配额轨各占相同位置一周。配额轨应在指定维上覆盖更高、被判出错更低。若两轨体验无差别,配额规则其实没在工作。