L6.06.4compositional sensitive inference设计研究

非敏感行为的组合可以推出敏感属性,逐项合规不等于整体合规

别名: 组合推断 · 逐项合规 · mosaic inference

概念解释

单独看,买维生素、搜停车位、凌晨打开某类视频,每一项都可以被标成普通兴趣。合在一起,分类器就能吐出健康或性相关的标签。组合式敏感推断(compositional sensitive inference)指:敏感属性可以从非敏感行为的联合分布里长出来;对每一项行为做合规审查,过不了这一关。

逐项合规是清单思维。整体合规要问:这些痕迹拼起来能看见什么。

机制

分类器吃的是向量,不是单项政策。每一维都可以在「非敏感」清单上,决策面仍然可以对敏感类可分。特征工程还会主动造交叉项(共现、时序、地点),把本来分散的痕迹收成代理。于是「我们没有健康字段」可以和「我们在估健康」同时成立。

审查若停在字段名,就会放行整包代理。限制敏感类推断的闸门如果只挡标签名、不挡可重构该标签的特征组合,闸门是空的。这是合成问题,不是命名问题。

怎么研究

方法是马赛克测试:准备一组单独看来都允许的行为特征,训练敏感属性分类器,看联合预测力相对单项的增量。自变量:特征是否允许交叉、时间对齐窗口、去掉任一单维之后的性能下降。因变量:对敏感类的可识别程度、代理特征的置换重要性。

若去掉任何一维后预测力仍高,说明冗余组合很多,逐项删除不够。还要测「用户以为这些是分散的普通点击」与「系统已有一条敏感分数」之间的知情差距。

边界

极短会话、特征极少时,组合成不了稳定分类器,风险主要在长期档案。明文敏感字段已经被禁的系统,组合问题反而更中心——人们会改走代理。这条不重新定义哪些类算敏感,只说敏感可以从联合里长出来。展示该结果、共享屏幕上被第三人看见,是披露层,不是合成层。

怎么落地

  • 合规审查按「能否重构敏感类」做,不只按字段名。对候选特征包跑一次敏感属性探测,超阈值的包整包拒绝或降级。
  • 禁止为排序或广告自动生成跨敏感代理的交叉特征;内容相关的共现(螺丝刀与螺丝)可以留。
  • 验证:在不含敏感字段名的特征包上训练探测模型。若对健康、性取向、政治等仍可分,逐项合规已经失败,需要改包而不是改字段名。

延伸

  • 同组L6.06.1 行为推断可能触及未主动披露的信息 · L6.06.2 推断结果的展示本身构成披露 · L6.06.3 敏感类别的推断需要额外限制 · L6.06.5 推断结果在共享设备与共享屏幕上会向第三方披露 · L6.06.6 推断错误同样造成伤害,被错误归类者往往无处申诉 · L6.06.7 用户对推断的容忍度取决于场景,同一推断在不同产品中评价不同 · L6.06.8 退出推断与退出数据采集是两件事,应分别提供开关
  • 相邻L6.08 过滤气泡与多样性 · L5.08 反事实解释 · L4.06 代理的权限边界
  • 站内检索compositional sensitive inference · mosaic inference · feature combination leakage

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L6.06.4