P4.10.3Historical data as recorded decisions设计研究

历史数据记录的是过去的决定而非事实

别名: 标签即决定 · measurement versus decision · construct validity of labels

概念解释

机器学习管线把历史数据当作「发生过的事实」来学,但多数历史数据记录的其实是过去的决定:逮捕记录记录的是警方在哪里布控、拦下谁,不是谁犯了罪;贷款拒绝记录记录的是银行当时的放贷政策,不是谁真正会违约;医疗支出记录记录的是谁看得起病,不是谁病得更重。以决定为标签训练的模型,学到的不是目标构念的预测器,而是历史决定过程的复述器——它会忠实地把过去的政策、偏见与资源分配再生产一遍,还带着「数据驱动」的客观外衣。

机制

污染的路径是构念替换。系统想预测的构念(犯罪风险、违约概率、健康需求)不可直接观测,于是用可得的代理(逮捕、贷款结果、医疗账单)替代;代理 = 构念 + 采集过程的系统性扭曲,模型无法把两者分开,只能一起学。更糟的是决定的自证实结构:被拦查多的人群留下更多记录、更多记录触发更多布控——决定制造了「证实」决定的后续数据。时间维度加深问题:社会规范与政策随时间变化,几十年前的决定(某地区曾被视为高风险故拒绝服务)沉淀在数据里,而今天的世界已经不这样运作,模型却在向过时的决定分布对齐。

怎么研究

构念效度检验是核心方法:对「标签测量的究竟是什么」做系统分析,追问标签与目标构念之间的理论链条,寻找标签的决定性来源(谁做的决定、受什么政策约束)。偏差标签分析比较代理与更接近构念的测量:以逮捕记录对真实犯罪的自我报告调查、以医疗支出对健康量表,估计「决定带来的扭曲」在标签中占多少。自然实验利用政策变化:当布控政策或放贷规则改变而底层人群行为未变时,标签分布的漂移量即为决定过程的贡献。方法论注意点:更干净的构念测量往往自身也有偏差(自我报告低报),分析结论以「扭曲区间的估计」而非精确值为宜。

边界

并非所有历史数据都是决定:物理测量、交易完成记录、用户主动提交的内容,受决定过程污染小——「决定型标签」主要集中在涉及机构裁量与资源分配的领域(执法、金融、医疗、教育)。历史数据也不因此不可用:在决定过程已显著改善、且扭曲方向已知的场景,去偏与重加权能部分修正;边界在于修正的前提是承认标签是被决定的,而多数失败案例始于否认这一点。

怎么落地

  • 为每个标签写「来源解剖」:这个数字由谁在什么规则下产生,是测量(传感器读数)还是决定(人工裁量、政策阈值),决定型的标注其裁量主体与当时政策。
  • 对决定型标签寻找构念更近的对照测量做一次偏移估计,偏移量超过预设阈值时,该标签不得单独用于人群相关的预测目标。
  • 决策留痕进数据:历史决定的理由(当时政策版本、裁量依据)作为元数据保存,使事后能区分「构念信号」与「决定信号」。
  • 验证:模型上线后对被其决定影响的人群追踪结果分布——若模型输出与历史决定的相关远高于与实际结果的相关,即构念替换未修正,重新设计标签。

延伸

  • 同组P4.10.1 标注者的构成与判断标准也是数据的一部分 · P4.10.2 采集渠道决定谁根本没有进入数据
  • 相邻P4.09.3 反馈回路对记录的自我强化 · Q3 定量方法中的构念测量
  • 站内检索construct validity · biased labels · measurement versus decision

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/P4.10.3