P3.01.1Variable reward设计研究

不确定的奖励最能维持重复行为

别名: 可变强化 · 间歇强化 · variable ratio schedule · partial reinforcement

概念解释

变量奖励(variable reward)指同一个行为之后,奖励是否出现、何时出现、价值多大都不可预测的安排。它维持重复行为的能力超过任何固定奖励:固定奖励在停止供应后行为迅速消退,而不确定奖励下的行为在奖励完全停止后仍会持续很久,过程中几乎不存在「满足了、可以停了」的饱和点。

机制

差异出在强化程序(schedule of reinforcement)的信息结构上。固定程序下,有机体很快学到「这次之后没有奖励」的规律,奖励一停,停止的证据立刻可得,行为随之消退。可变程序(尤其可变比率,variable ratio)下,任何一次未获奖励都无法证明「奖励没有了」——按定义,下一次就可能命中。行为系统对「未获奖」的解读被系统性扭曲:空白被读成「继续」而不是「停止」。这就是部分强化消退效应(partial reinforcement extinction effect):经历过不确定奖励的行为,比经历过固定奖励的行为难消退数倍。同时奖励幅度的波动使期待无法锚定在一个稳定预期上,每次兑现都像第一次。

怎么研究

操作性条件反射的强化程序实验是源头范式:同一行为分别置于固定与可变程序下,比较反应率与消退曲线。常见自变量是程序类型(固定/可变 × 比率/间隔)、奖励概率与幅度;因变量是反应率、消退阶段的持续反应数。在界面研究里用于评估反馈设计(点赞数的波动、随机出现的内容奖励)对重复使用曲线的影响。方法论注意点:实验室单次会话测得的消退曲线难以外推到数周日常习惯的形成;自报的「受吸引程度」与实际使用频率的相关有限,需要以行为日志为准;奖励的「不确定」要向被试真实成立,预告过的随机不产生可变程序效应。

边界

可变程序维持的是行为频率,不保证主观价值——行为完全可以在用户自评体验很差的情况下持续,这一断裂正是成瘾设计判据的起点。对服务明确目标的等待(等一封关键邮件、等结果公布),不可预测是世界的属性而非设计注入的手段,判据不在奖励是否可变,而在可变性是否被人为制造并服务于停留。维持效果还依赖尝试机会高频且低成本;当单次尝试需要高投入时,可变程序的效率大幅下降。

怎么落地

把「奖励是否可变」当作需要论证的设计决策而非默认状态。列出产品中所有「用户行动之后可能得到什么」的时刻,逐项标注奖励量的稳定性与波动来源:波动来自真实世界(别人是否回复),还是被人为注入(随机掉落、抽奖)。凡人为注入者,回答「这个回路是否服务于用户自己的目标」,答不上来就改成固定反馈。验证办法:关闭随机性前后各跟踪两周,对比会话频率与自评有用度——若频率下降而自评不降,说明此前的频率由机制而非价值维持。

延伸

  • 同组P3.01.2 该机制直接作用于强化学习回路 · P3.01.3 用于非必要场景时构成成瘾设计
  • 相邻P3.07 变量奖励与成瘾机制 · P3.02 无限滚动
  • 站内检索variable reward · intermittent reinforcement · partial reinforcement extinction effect · variable ratio schedule

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/P3.01.1