C4.24.4Confidence threshold as product decision设计研究

置信度阈值调整是产品决策,不能单纯依赖模型默认输出

别名: 阈值是产品决策 · 模型默认 · 工作点

概念解释

识别模型随权重附带一个默认切分点,那是训练脚本或竞赛指标下的数字,不是产品里该用的工作点。阈值调整是产品决策:谁在什么场景里用、错一次的代价、能否重试,都比「验证集 F1 最大」更优先。把 model.conf_th = 0.5 直接上线,等于把产品政策外包给了训练时碰巧用的那条指标。

机制

训练常用的交叉熵、准确率或宏 F1 把两类错误等权,或按数据集里的类频率加权,那些频率很少等于真实使用里「挥手告别」对「确认删除」的比例。默认 0.5 往往来自未校准的 sigmoid,连概率都不是。现场的镜头高度、人群、灯光会把分数分布整体挪动,实验室最优点到了展厅就偏了。产品还可能要按国家、场所、无障碍模式提供不同工作点。这些都无法从 checkpoint 文件里读出来。识别服务可以提供建议阈值,决策权应留在产品配置,并留下可回滚的版本。

怎么研究

冻结模型权重,只扫阈值,在实验室集、现场录像、以及故意加入非手势背景的集合上分别找「指标最优」和「用户不可接受点」。展示这几个点通常不重合。做一次「沿用默认」对「按现场重标」的对照。把决策过程记录成:谁批准了这个数字、依据哪一批数据、准备何时重评。研究方法本身就是在证明阈值不是模型的附属品。

边界

模型若输出已经过现场校准的概率,并且产品只有一个低后果命令,默认点碰巧可用,但仍应被写成显式配置,以便下次模型升级时不被新的 0.5 覆盖。自动阈值选择(按近期误触发率漂移)把决策变成了在线算法,需要边界,否则一次异常活动会把灵敏度锁死。竞赛或论文里报告的阈值不能当现场数字用,那是另一个数据分布。

怎么落地

  • 把每条命令的阈值放在产品配置里,与模型文件分开版本;升级模型时默认「沿用产品阈值」,只有明确重标才改。
  • 变更阈值走一次含背景动作的回放集,分别看漏判和误判,而不是只看模型卡上的准确率。
  • 文档写明当前工作点的批准人和数据批次,避免下一次迭代以为「0.5 是识别器规定的」。

延伸

  • 同组C4.24.1 识别系统对每次判定给出置信度,而非非黑即白的结果 · C4.24.2 低置信度时系统需要选择宁可漏判还是宁可误判的偏置方向 · C4.24.3 偏置方向应根据动作后果的严重程度而非统一设定
  • 相邻C4.25 降级路径的预先定义 · C4.05 手势评价的三个维度
  • 站内检索threshold · operating point · product policy

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/C4.24.4