L6.04.3external loop-breaking signal设计研究

需要外部信号打破自我强化

别名: 外部信号 · 打破闭环 · exogenous exploration

概念解释

闭环里的每一步都在确认上一步。要从内部走出来,必须有一样东西不是这个用户、这次展示、这次点击产出来的:外部信号(external loop-breaking signal)——编辑名单、其他队列的流行、主动探索槽、用户写出来的纠正、与当前模型无关的随机或结构化注入。没有外来项,自我强化没有断点。

「再训练一轮」不是外部信号。新一轮仍吃同一回路里的标签。

机制

自我强化的定点是:展示政策产出行为,行为训练出几乎同一政策。定点可以很稳,稳得像口味,其实只是没有扰动。打破定点需要一个对当前参数正交的输入,否则梯度还是沿着原方向走。

外部不等于随意。编辑位带来的是他人的判断;跨队列流行带来的是别人的点击,不是这个人的回声;探索槽带来的是系统设计的查询。它们的共同点是:标签生成过程不在这个用户的闭环里。把这些标签与闭环标签混在一个损失里而不加标记,外部信号会被下一轮再吞掉——所以外部必须作为单独通道被保护。

探索的即时体验成本和离线评估对日志政策的偏向,是更细的操作问题。这里只要求:断点必须来自回路之外。

怎么研究

在已进入稳态的用户上注入外部源:编辑轨、跨组热门、小比例与模型无关的条目,对照「只继续闭环」。看稳态列表是否移动、用户是否把注入判成出错、注入停止后移动是否回弹。自变量:外部源类型、注入比例、是否在训练里单独加权。因变量:列表相对稳态的漂移、回弹时间、主观「被打扰」。

探索–利用的后悔分析可以描述注入的效率,但不要把最低后悔自动当成最好的用户体验。外部信号的 HCI 问题是:人能不能理解「为什么突然出现这个」,以及停止注入后回路会不会立刻合上。

边界

用户已经用筛选、搜索、订阅从外部给了强信号时,再注入是叠床架屋。合规与安全名单是另一种外部信号,目的是限制而不是打开回路。物品池极小、外部源与内部高度重叠时,注入看不出差别。这条论证「断点必须从闭环外进来」,不处理偶然点击如何冻进画像,也不处理离线评估吃自己的日志。

怎么落地

  • 给外部源一个不会被主模型重训吞掉的通道:独立轨,或在损失里对外部标签单独加权并封顶。
  • 标明来源:「编辑在推」「其他地区在看」,让外来项可被理解,而不是假装成「更懂你」。
  • 验证:对一批稳态用户停止一切外部注入两周,再打开编辑轨一周。列表若在停止期钉死、打开后才移动,说明此前的稳定来自缺少断点,不是来自已经找准口味。

延伸

  • 同组L6.04.1 展示影响行为,行为再影响展示 · L6.04.2 回路会放大初期偏差
  • 相邻L6.09 反馈回路与偏好固化 · L6.08 过滤气泡与多样性 · L6.13 推荐的负面反馈通道
  • 站内检索external loop-breaking signal · exogenous exploration · editorial injection

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L6.04.3