打破回路需要主动探索,而探索的成本立即可见、收益延后
别名: 探索代价 · 利用-探索 · delayed exploration return
概念解释
要知道未展示项是不是好的,只能先把它放出来。放出来的这一次,用户多半会觉得「不如原来准」,点击掉、抱怨来。过若干会话,模型才可能用这次观测把列表开宽。探索的成本在当下、收益在以后(exploration cost now, benefit later)指:打破曝光闭环必须付一笔即时体验账,而账要到未来才可能从覆盖和发现里收回。
外部信号给出断点。这里要钉的是这笔账的时间结构,以及为什么产品会系统性少付。
机制
探索–利用把每次展示写成:利用当前最优,或探索以减不确定。利用的奖励立刻进点击;探索的奖励是信息,信息要折现。用户折现更陡——他们过的是这一屏,不是后悔 bound。于是界面上的探索槽被读成变差,运营用点击把槽收掉。
信息是系统的,不适是用户的。若不适没有被解释、没有被限制在可跳过的位置、没有用后续变好来兑现,用户不会同意续付。epsilon-greedy、Thompson 抽样可以在模拟里降后悔,但不会自动处理「这一屏为什么突然不准了」。HCI 要把探索做成可理解的交易,而不是把估计器直接铺在首屏。
怎么研究
在稳态用户上打开探索槽,记录即时点击、主观变差、以及随后若干会话的覆盖与发现(新类被点)。自变量:探索比例、位置(首屏 vs 末尾)、是否标明「试一个新的」、是否允许跳过且不记负。因变量:即时成本、延迟收益、中途关掉探索的比例。
后悔曲线描述系统侧效率。必须并排报用户侧的即时评分。只报长期 nDCG 会把当下那笔账藏起来,而这正是探索在产品里活不下去的原因。
边界
用户主动进「发现」轨,是他们自己把成本提前付了,首屏不必再摊。安全与库存限制了可探索集合时,乱探是伤害。冷启动的探索是为了有第一笔观测,成本结构不同(本来就没有可利用的准)。这条讲时间结构,不重写曝光偏差定义,也不把离线评估的政策偏向再讲一遍。
怎么落地
- 把探索放在可跳过、可标记的位置,并写「试一个你可能没见过的」。不要把探索项和主排序的「为你」混成同一句承诺。
- 跳过探索项不当负例;点了且完播,才记信息。
- 验证:打开探索两周,首周点击允许按预算下降,但第二周覆盖或新类点击应上升。若只见下降不见收回,要么比例过大,要么收益没有被兑现给用户——把槽从首屏挪走或把标记写清楚再测。