Z2.08.2Persistent correction设计研究

纠正应更新未来判断而非仅修正当次结果

别名: 纠正的持续性 · 学习式纠正 · corrective feedback

概念解释

用户纠正一个情境判断时,预期几乎从来不只是「这一次改对」:说「我没在睡觉」的人,意思是以后别在这个情境下再这么判——纠正携带的是规律,不是事件。系统若只把当次结果覆盖过去、判断机制原封不动,同一个错误明天照旧发生;用户的体验是「说了也白说」。

纠正因此要有两个语义层次:当次修正(覆盖这一次的输出)与未来更新(改变产生输出的机制——规则、阈值或模型)。最低要求是当次修正,真正兑现纠正承诺的是未来更新:同类情境再次出现时,判断已经变了。

机制

为什么「只修当次」必然失败?因为情境判断是机制的重复输出:同样的传感器读数、同样的时段、同样的规则,明天会再产出同样的错误结论。当次覆盖改的是输出快照,机制还在原地——错误不是被修复了,是被按下了暂停,到下一次触发再播放。

而完整的纠正要求系统能把「这次否决」泛化到未见的未来情境——这正是难点所在。用户的一个「不对」信息量极小(只否定了这一个点),要从单点否定推出机制该改哪里,系统必须猜测泛化范围:是这类时段?这个房间?这种传感器组合?猜窄了明天还错,猜宽了把对的也改错。泛化猜测失败的两个方向都有代价,这是纠正设计真正的技术核心。

第三层机制在用户侧:纠正不被兑现时,用户会升级纠错成本——先纠正,再抱怨,最后绕开(把误判的功能关掉)。每一步都在降低系统拿到的反馈量,直到彻底失聪。反馈通道的存续依赖「反馈有效」这个朴素预期。

怎么研究

  • 交互式机器学习对反馈语义有系统研究:单次否定样本如何影响后续预测,取决于学习率、泛化边界与反馈的解释框架;这批文献的发现(用户反馈的「一次纠正、多层含义」结构)直接适用于情境判断。
  • 偏好学习(preference learning)与在线学习提供了「从纠正中更新」的算法框架:纠正作为标注样本进入更新循环,评测指标是更新后同类错误率的下降幅度与新错误(过度泛化)率的上升幅度——两条曲线必须一起看,只报前者会鼓励系统激进学习。
  • 评测范式:部署中注入固定序列的同类判断错误,比较「仅当次覆盖」与「带未来更新」两版系统在第二次、第三次错误时的表现;同时量用户的重复纠正率——用户为同类错误纠正几次之后放弃,是「纠正承诺是否兑现」的行为度量。

方法论注意点:「未来更新」的效果评估必须跨足够长的时间窗——学习型更新的收益显形在数周后,短期 A/B 会系统性低估它;而过度泛化的伤害同样滞后,评估窗口太短两头都看不见。

边界

  • 不是所有纠正都该泛化。 用户有时就是要单次例外(「今天让我睡沙发」不代表改变睡眠判断)——这就是为什么纠正入口要区分「当次」与「以后」两个语义,让用户选,而不是替用户猜;猜错的泛化比不泛化更伤信任。
  • 规则型判断的更新路径有限。 基于 if-then 规则的判断没有可微调的模型,纠正只能改条件或加例外——更新的粒度是离散的,常常只能在「过窄」与「过宽」之间跳档,体验远不如学习型平滑;诚实告知局限好过假装学会了。
  • 多人共用设备的纠正会互相污染。 两口子作息不同,一方的「以后别这么判」会破坏另一方的判断准确度——共享情境里纠正更新要走按人分模型的路径,否则纠正变成零和。

怎么落地

  • 纠正入口默认问一句作用范围:只这一次 / 这类情况都改 / 连传感器设置一起看。三档显式分开,不默认替用户选最大档。
  • 每次纠正落地后给可验证的回执:「已更新:以后 22 点后手机静止不再判入睡」——把泛化范围说出来,用户才有机会当场纠正「泛化过头了」。
  • 维护纠正历史:哪些纠正生效了、泛化到什么范围、后续触发过几次——既是用户复核入口,也是系统性偏差分析的数据源。
  • 验证办法:对每类常见误判跟踪「用户平均纠正次数」——同一个人同一类错误纠正 1 次后不再出现为合格;同时监控纠正后的新错误率(过度泛化指标),两项一起构成「未来更新」的验收。

延伸

  • 同组Z2.08.1 纠正入口需要在判断结果生效的当下出现 · Z2.08.3 无法纠正的情境判断会被用户视为不可信 · Z2.08.4 频繁纠正意味着传感器或模型本身存在系统性偏差
  • 相邻Z3.04 隐式与显式的并存 · Z3.07 自动化与用户习惯的相互塑造
  • 站内检索corrective feedback · interactive machine learning · preference learning · overgeneralization

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/Z2.08.2