Z3.04.3Learning from overrides设计研究

覆盖行为应被系统学习

别名: 从纠正中学习 · preference learning · 交互式学习

概念解释

用户每一次覆盖自动化的操作都是一次偏好表达——系统应当把覆盖当作训练信号学习,而不是当噪声丢弃,也不是仅仅当次生效完事。同组兄弟分工:一条管「这一次听用户的」,一条管「冲突时显式优先」;这条管「听见了要记住」。它把显式纠正转化为隐式改进:用户用行动投票,系统记账。

记账的内容有两个可能的对象,混淆就学错:参数(舒适温度从 24 调到 22)与规则(这个时段干脆别自动化)。单次覆盖可能是例外(今天有客人)而非新偏好(以后都这样),系统从单次事件分辨不出是哪种——这是学习设计的核心难题。

机制

覆盖信号的信息结构让它成为高质量训练数据:它带情境(何时、何条件、谁操作的)、带方向(用户想要什么而不是不要什么)、带代价证明——用户为这次纠正付出了操作成本,愿意付费的信号比点赞类反馈强一个量级。

但学习的两端都是坑:

  • 过拟合:从一次覆盖立刻永久改变默认行为。今天有客人所以开了盏平时不开的灯,系统从此每天开——用户被系统的过度反应激怒。
  • 欠拟合:从不学习。用户每周一都手动调同一件事——系统对这种规律性视而不见,用户被迟钝激怒。

区分「例外」与「改主意」需要证据积累:多条独立证据才固化成新默认,单次覆盖先存疑或当场询问。用户自己的语言往往已经给出答案——「就这次」和「以后都」是不同的意图,入口把这两种分化出来,比让系统猜可靠得多。

怎么研究

  • 学习型温控器的实地研究:Yang 与 Newman 2013 年对 Nest 温控器的入户研究记录了用户与「学习」机制的真实互动——用户误解它怎么学(以为它在录音、以为叶子标识是奖励要刻意维持),并发展出各种「教它」的方式。结论直接支持两条设计要求:学习过程要可见,学到的内容要可查。
  • 交互式机器学习:从少量人类反馈增量更新模型的通用框架,核心共识是小样本反馈的样本效率决定可用性。
  • 方法上采用带学习与不带学习的对照部署,度量后续覆盖率衰减曲线(学习有效则覆盖随时间下降)与误学习率(用户申诉「我没让它这样」的频率)。

边界

  • **不是所有覆盖都是偏好声明。**有的是对故障的反应(自动化本身坏了),有的是临时例外(来客、假期)。把故障性覆盖当偏好学,等于把缺陷固化进模型——学习之前先排除「系统出错」这一解释。
  • **多用户家庭的信号归属不明。**谁覆盖的、代表谁的偏好,识别不了就会把一个人的偏好学给全家(比如把夜班成员的深夜作息学成全屋默认)。
  • **覆盖学习需要告知。**用户未必预期「我关掉它」会变成训练数据;在隐私敏感领域(健康、在场),静默学习本身就是隐私问题。

怎么落地

  • 提供「系统从我这里学到了什么」的视图:逐条列出从覆盖中学到的调整,逐条可删除——不可见的学习等于暗中学人。
  • 保守学习策略:同类覆盖累计多次或跨多天后再改变默认行为;单次覆盖只影响当次,或当场分化询问「仅这次 / 以后都这样」。
  • 例外与偏好分轨存储:明确标记为「仅这次」的操作进入例外表(有有效期),不进入长期模型。
  • 验证办法:跟踪覆盖率随时间的衰减曲线与误学习申诉率;做「单次例外」测试——用户明确选过「仅这次」的操作之后,系统行为不应发生任何永久改变。

延伸

  • 同组Z3.04.1 隐式路径不能取代显式控制 · Z3.04.2 显式操作应能覆盖自动行为
  • 相邻Z3.06.4 接管操作应被系统记录用于改进后续判断 · Z3.05.4 学习型自动化的行为漂移会持续削弱可预测性
  • 站内检索learning from user feedback · preference learning · interactive machine learning · Nest thermostat

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/Z3.04.3