不使用敏感属性不等于结果无差别
别名: 无意识公平 · unawareness fallacy · blindness approach
概念解释
「无意识公平」(fairness through unawareness)指一种直觉做法:从特征表里删掉性别、种族、年龄等敏感属性,模型「看不到」它们,输出自然就不带歧视。这个推理是错的。删掉敏感列只移除了显式标注,模型从其余特征的组合中仍能恢复出敏感属性的相关信息,结果的群体差异照旧存在——只是失去了可审计的抓手。正确的问题从来不是「输入里有没有敏感属性」,而是「输出在人群间怎样分布」。
机制
敏感属性的信息在特征空间中高度冗余:住址邮编与社区构成、消费品类与收入、用词语序与语言背景、设备型号与经济层级、名字与性别和文化归属——任一组合都足以让模型把被删除的属性重建到可用精度。模型不需要「知道」种族也能执行种族相关的模式:它学到的是与种族强相关的行为与情境特征,效果上等同于直接使用。更糟的是删除让歧视转入地下:带敏感列时还能直接检验「控制其他变量后该属性是否影响输出」,删除后连这个检验都做不了——审查者同样看不到属性,差异化影响被发现的可能性反而下降。法规实践也因此明确:仅凭「未使用敏感属性」不能免除差异化影响的责任。
怎么研究
消融审计是标准方法:比较「含敏感属性」与「删除后」两版模型在各群体的输出分布,若删除前后群体差异基本不变,即证实无意识路线失效。重建实验从另一侧验证:仅用被允许的特征训练敏感属性预测器,其预测精度显著高于随机,即说明信息仍在。研究变量包括特征集丰富度(特征越多冗余越高)、群体基础比率与地理粒度。方法论注意点:重建实验存在伦理边界——它证明了可重建性,也顺手生产了敏感属性的推断能力,实验数据须隔离与销毁;审计用的群体标签来自自报或代理,错分率要随结论一并报告。
边界
主张「删除无效」不等于「保留敏感属性永远更好」:在特定约束下(特征极少、与敏感属性相关性弱的简单模型),删除确实能削弱部分直接效应;某些法域也确实禁止在特定决策中处理敏感属性,此时合规要求删除,但删除后必须改用输出分布审计来承担公平监督——输入侧的禁令与输出侧的责任并行不悖。判定「无差别」的唯一口径始终是结果的群体分布,而不是特征的清洁程度。
怎么落地
- 把公平审计从输入清单转向输出分布:无论特征表里有什么,按人群分层报告通过率、错误率与分数分布。
- 保留(在合规允许下)或单独采集敏感属性用于评估与监控,评估数据与训练数据物理分离,只进审计管道。
- 高风险决策上线前做一次重建实验,量化「被删属性的可恢复程度」,写入模型文档作为无意识路线失效的证据。
- 验证:定期用真实结果复核输出分布的群体差距——差距扩大时,先查特征集新增了哪些与敏感属性强相关的新特征。