Z1.03.3Inference uncertainty设计研究

情境推断天然存在误差

别名: 推断不确定性 · probabilistic inference · 情境推断误差

概念解释

情境不是被读出的,是被推断的——从有限的、带噪声的传感数据到「用户正在做什么」的概率判断。这条知识的内容是:这个推断过程的误差不可消除,它是情境系统的结构性属性,不是工程缺陷。

误差不可消除的原因在于问题本身的形式:真实情境状态(用户在睡觉)从未被直接观测,系统只有间接证据(不动、心率低、灯灭)。任何基于不完全证据的推断都有残余不确定性——这与传感器的品质无关,加钱买更好的传感器只能把误差压小,不能把它归零,因为信息根本不在数据里(静止的人既可能在睡觉也可能在看书,证据不区分这两者)。

机制

误差的来源是分层的,每层都贡献不可消除的部分:

  • 证据层的模糊性。 不同情境状态产生相同传感证据(睡觉与安静阅读在 PIR + 心率上同相),这是类的可分性问题——证据本身不含区分信息,任何分类器都无能为力。这是不可消除误差的下界。
  • 先验层的偏置。 推断模型必带先验(多数人十一点后睡觉),对偏离先验的个体(夜班护士、失眠者)产生系统性误判——误差不是随机的,而是偏向多数模式,少数生活习惯承担多数误判。
  • 分布层的漂移。 模型从历史数据学习,但生活在变:换工作、孩子出生、季节更替改变行为分布,训练分布与部署分布的偏差随时间累积——情境分布是非平稳的

三层叠加的后果:报告「95% 准确」的活动识别,在偏离典型用户、非典型时段、部署半年后,实际准确率可能显著低于实验室数字。误差可以被压缩、被监测、被设计吸收,但不能被消灭——所以系统的下游设计必须以「判断可能错」为常态输入

怎么研究

  • 混淆矩阵与分场景报告:不只报总体准确率,按用户类别、时段、场景分层报告误报/漏报——误差的分布比均值更能预测实地表现。
  • 非平稳性研究:纵向部署研究追踪同一模型准确率随月份的衰减曲线,量化漂移速度;自适应/在线学习方法(部署后继续学习)与冻结模型的对照。
  • 不确定性量化:让模型输出置信度而非仅类别(概率输出、集成方差),研究置信度与真实错误率之间的校准(calibration)——一个 80% 置信的判断是否恰好 80% 的时候是对的。校准良好的置信度可以被下游规则直接使用。

方法论注意点:实验室的干净数据(按规程执行动作、单一被试环境)会同时改善三类误差来源,得出过于乐观的数字;带真实噪声与真实作息的 in-the-wild 数据集才是设计决策的依据。

边界

  • 误差不均摊。 误判集中投向非典型用户与非典型场景(夜班者、多代同堂、小户型多人重叠),平均准确率掩盖了这种结构性不公——评估要看误差的最坏分位,不是均值。
  • 置信融合有边际上限。 多信号融合在信号高度相关时收益有限(PIR 与摄像头都被同一只猫触发);独立证据源才真正降不确定度,而独立性恰恰是隐私敏感的(要更多不同种类的采集)。
  • 误差性质决定后果性质。 漏报型误差(在睡觉被误判为不在)与误报型误差(不在被误判为在)的下游代价完全不同——消除误差做不到,但选择承受哪种误差是设计的可控变量。

怎么落地

  • 把推断输出连同置信度一起传给行为层,行为规则按置信分级:高置信自动执行、中置信建议、低置信只记录不动作。置信的阈值从校准数据里来,不是拍的。
  • 对每类情境判断,明确愿意承受哪种误差:安防类宁可误报(误开警报),便利类宁可漏报(不触发也无妨)——误差偏好是产品决定,要成文。
  • 给模型部署设定复核节奏:按月抽检判断与自陈的吻合率,吻合率跌破阈值触发重新训练或人工规则兜底,不接受一次训练永久使用。
  • 验证办法:维护一张「判断 → 实际 → 后果」的误差台账,按用户与场景分组统计;把误差最集中的前三个场景列出来,逐个回答「换代理、加冗余、还是改保守」——答不出就说明该判断不该自动化。

延伸

  • 同组Z1.03.1 情境包括位置、时间、活动与在场者 · Z1.03.2 传感器只能获取情境的代理指标
  • 相邻Z2.02 推断的不确定性 · Z2.03 误报与漏报的代价
  • 站内检索activity recognition · calibration · concept drift · uncertainty

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/Z1.03.3