L3.13.3feedback is self-selected and extreme设计研究

提交反馈的人是自我选择的少数,极端体验被过度代表

别名: 反馈自选择 · 极端体验 · nonresponse bias

概念解释

一千次生成里有十二次点了踩或赞。这十二次里,大半是骂得最狠或爱得最深的人。中间「还行、有点错但不值得点」的那一大群沉默。用这十二次去调模型,等于让极端体验当全体用户。反馈自选择(self-selected feedback)指的是:交出来的样本不是随机质量抽检,极端被过度代表,中间状态几乎不进数据。

点踩没有位置,是粒度。这里连「谁会点」都已经偏了。

机制

提交要付一点成本,只有效用超过成本的人才付:被惹怒、被取悦、职业上必须报。中等质量、中等情绪达不到这个阈值。于是分布在两端加厚、中间掏空。再训练或排期若按反馈计数,会去修极端案例,放过占量最大的中等失败。

沉默不是中性。将就发出去的人、看完既不赞也不踩的人,往往是产品真正的日常质量。把他们读成「没意见所以合格」,是把非响应当成通过。

怎么研究

对全体会话做质量抽检(人工或金标准),再对比自愿反馈集合。因变量:两端占比、中间质量在反馈里的覆盖、按反馈调参后日常错误率是否下降。自变量:反馈入口的摩擦、是否主动抽样弹窗。

主动抽样(随机弹出「这一条请评一下」)是对照,用来估计自愿集合的偏。

边界

安全与辱骂必须走极端通道,不能因为「会过度代表」就压掉。量极小的产品,自愿反馈可能是仅有的信号,但解释时仍要当极端样本。编辑行为覆盖更广的沉默用户,可补这一偏,那是另一条。这条不处理反馈有没有回音。

怎么落地

  • 不要只用自愿赞踩当训练或排期的分子。配一套随机抽检,专门覆盖沉默的中间。
  • 报表上把自愿反馈标成「极端样本」,不要写成「用户质量评分」。
  • 降低中间用户的表达成本(随机一条、一题、不问长理由),但不要指望他们变得像极端用户那样勤。
  • 验证:把自愿反馈的错误类型和随机抽检比。若自愿里几乎只有辱骂和天花乱坠的夸,中间事实错没有出现,自选择已经在主导。

延伸

  • 同组L3.13.1 点赞点踩收集到的是满意度,不是正确性 · L3.13.2 未指明具体位置的负反馈无法用于定位问题 · L3.13.4 用户的编辑行为是比显式评分信息量更大的隐式反馈 · L3.13.5 反馈若不产生可见变化,提交率会迅速衰减到接近零
  • 相邻L3.12 生成内容的编辑与接管 · L6.13 推荐的负反馈通道
  • 站内检索self-selection bias · extreme responding · nonresponse

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L3.13.3