L6.09.4exploration cost now, benefit later设计研究

打破回路需要主动探索,而探索的成本立即可见、收益延后

别名: 探索代价 · 利用-探索 · delayed exploration return

概念解释

要知道未展示项是不是好的,只能先把它放出来。放出来的这一次,用户多半会觉得「不如原来准」,点击掉、抱怨来。过若干会话,模型才可能用这次观测把列表开宽。探索的成本在当下、收益在以后(exploration cost now, benefit later)指:打破曝光闭环必须付一笔即时体验账,而账要到未来才可能从覆盖和发现里收回。

外部信号给出断点。这里要钉的是这笔账的时间结构,以及为什么产品会系统性少付。

机制

探索–利用把每次展示写成:利用当前最优,或探索以减不确定。利用的奖励立刻进点击;探索的奖励是信息,信息要折现。用户折现更陡——他们过的是这一屏,不是后悔 bound。于是界面上的探索槽被读成变差,运营用点击把槽收掉。

信息是系统的,不适是用户的。若不适没有被解释、没有被限制在可跳过的位置、没有用后续变好来兑现,用户不会同意续付。epsilon-greedy、Thompson 抽样可以在模拟里降后悔,但不会自动处理「这一屏为什么突然不准了」。HCI 要把探索做成可理解的交易,而不是把估计器直接铺在首屏。

怎么研究

在稳态用户上打开探索槽,记录即时点击、主观变差、以及随后若干会话的覆盖与发现(新类被点)。自变量:探索比例、位置(首屏 vs 末尾)、是否标明「试一个新的」、是否允许跳过且不记负。因变量:即时成本、延迟收益、中途关掉探索的比例。

后悔曲线描述系统侧效率。必须并排报用户侧的即时评分。只报长期 nDCG 会把当下那笔账藏起来,而这正是探索在产品里活不下去的原因。

边界

用户主动进「发现」轨,是他们自己把成本提前付了,首屏不必再摊。安全与库存限制了可探索集合时,乱探是伤害。冷启动的探索是为了有第一笔观测,成本结构不同(本来就没有可利用的准)。这条讲时间结构,不重写曝光偏差定义,也不把离线评估的政策偏向再讲一遍。

怎么落地

  • 把探索放在可跳过、可标记的位置,并写「试一个你可能没见过的」。不要把探索项和主排序的「为你」混成同一句承诺。
  • 跳过探索项不当负例;点了且完播,才记信息。
  • 验证:打开探索两周,首周点击允许按预算下降,但第二周覆盖或新类点击应上升。若只见下降不见收回,要么比例过大,要么收益没有被兑现给用户——把槽从首屏挪走或把标记写清楚再测。

延伸

  • 同组L6.09.1 系统只能观察被展示过的内容,未被展示的项永远得不到正反馈 · L6.09.2 早期的偶然点击会被放大成长期稳定的画像特征 · L6.09.3 用户为获得想要的推荐而调整行为,行为数据因此失去代表性 · L6.09.5 用历史日志做离线评估会系统性偏向产生这些日志的现有策略
  • 相邻L6.04 反馈回路 · L6.08 过滤气泡与多样性 · L6.02 过滤气泡
  • 站内检索exploration-exploitation · exploration cost · delayed diversity return

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L6.09.4