L3.13.3feedback is self-selected and extreme设计研究
提交反馈的人是自我选择的少数,极端体验被过度代表
别名: 反馈自选择 · 极端体验 · nonresponse bias
概念解释
一千次生成里有十二次点了踩或赞。这十二次里,大半是骂得最狠或爱得最深的人。中间「还行、有点错但不值得点」的那一大群沉默。用这十二次去调模型,等于让极端体验当全体用户。反馈自选择(self-selected feedback)指的是:交出来的样本不是随机质量抽检,极端被过度代表,中间状态几乎不进数据。
点踩没有位置,是粒度。这里连「谁会点」都已经偏了。
机制
提交要付一点成本,只有效用超过成本的人才付:被惹怒、被取悦、职业上必须报。中等质量、中等情绪达不到这个阈值。于是分布在两端加厚、中间掏空。再训练或排期若按反馈计数,会去修极端案例,放过占量最大的中等失败。
沉默不是中性。将就发出去的人、看完既不赞也不踩的人,往往是产品真正的日常质量。把他们读成「没意见所以合格」,是把非响应当成通过。
怎么研究
对全体会话做质量抽检(人工或金标准),再对比自愿反馈集合。因变量:两端占比、中间质量在反馈里的覆盖、按反馈调参后日常错误率是否下降。自变量:反馈入口的摩擦、是否主动抽样弹窗。
主动抽样(随机弹出「这一条请评一下」)是对照,用来估计自愿集合的偏。
边界
安全与辱骂必须走极端通道,不能因为「会过度代表」就压掉。量极小的产品,自愿反馈可能是仅有的信号,但解释时仍要当极端样本。编辑行为覆盖更广的沉默用户,可补这一偏,那是另一条。这条不处理反馈有没有回音。
怎么落地
- 不要只用自愿赞踩当训练或排期的分子。配一套随机抽检,专门覆盖沉默的中间。
- 报表上把自愿反馈标成「极端样本」,不要写成「用户质量评分」。
- 降低中间用户的表达成本(随机一条、一题、不问长理由),但不要指望他们变得像极端用户那样勤。
- 验证:把自愿反馈的错误类型和随机抽检比。若自愿里几乎只有辱骂和天花乱坠的夸,中间事实错没有出现,自选择已经在主导。