行为推断可能触及未主动披露的信息
别名: 隐性推断 · 未披露属性 · behavioural inference
概念解释
用户没勾过「怀孕」、没填过年龄、没说过政治倾向,模型仍可能从搜索、停留、购买时序里把这些写进内部标签。未披露属性的推断(inferred undisclosed attributes)指:从行为估计出用户从未主动交给系统的个人信息,估计结果进入排序或广告,等于在用户不知情时扩了档案。
主动披露是表单上的字段。行为是做任务留下的痕迹。两者不是同一份同意。
机制
行为对潜在属性有统计相关:时段、类目组合、重复查询可以当作分类器的输入。推荐和广告系统有动机把这些分类器跑起来,因为标签能提高短期点击。推断发生在后台,界面仍显示「根据你看过的内容」,不显示「根据我们估计的你」。
人按任务模型给数据:为了完成购买、看完一集。任务模型不包括「顺便被估出敏感身份」。痕迹一旦可被二次使用,同意的边界就被推断穿过。这与把推断结果展示出来(那是披露)、与敏感类要额外限制,都不是同一层:这里只确认「未声明的属性可以被行为碰到」。
怎么研究
推断属性研究的标准做法是:用行为日志训练人口统计或敏感属性的分类器,在留出用户上测可识别程度(准确、校准、对少数类的召回)。自变量:可用行为种类(查询 / 购买 / 停留)、时间窗口、是否去掉显式资料字段。因变量:对未在资料里出现的属性的预测力、用户得知后的意外与不接受程度。
不要把分类器准当成「用户其实愿意给」。准只说明泄漏通道存在。对照应包括:告知用户正在估什么之后,还有多少人愿意继续贡献同样的行为。
边界
内容匹配(「你刚搜了螺丝刀所以出螺丝刀」)是会话内的查询扩展,不是对未披露身份的推断。公开角色(企业账号的职级)本来就在资料里,不算穿过同意。这条不处理把标签画在界面上会造成什么,也不处理组合非敏感行为推出敏感类——那是后续的合成问题。
怎么落地
- 列出系统正在估计、且资料里没有对应字段的属性,作为内部清单。没有清单就等于不知道自己穿过了哪里。
- 对清单上的每一项决定:停用、降为会话级、或改为显式询问。禁止默认「能估就估」。
- 验证:拿一份不含资料字段的行为样本,看内部标签服务还能吐出哪些人口或身份标签。吐得出且用户从未填过,就是未披露推断在跑。
延伸
- 同组:L6.06.2 推断结果的展示本身构成披露 · L6.06.3 敏感类别的推断需要额外限制 · L6.06.4 非敏感行为的组合可以推出敏感属性,逐项合规不等于整体合规 · L6.06.5 推断结果在共享设备与共享屏幕上会向第三方披露 · L6.06.6 推断错误同样造成伤害,被错误归类者往往无处申诉 · L6.06.7 用户对推断的容忍度取决于场景,同一推断在不同产品中评价不同 · L6.06.8 退出推断与退出数据采集是两件事,应分别提供开关
- 相邻:L6.05 个性化的可关闭 · L6.10 个性化的可关闭与可重置 · L5.05 透明度的适度原则
- 站内检索:
inferred undisclosed attributes·behavioural inference·sensitive attribute prediction