Q1.06.2De-identification and retention limitation设计研究
数据需去标识并限期保存
别名: 去标识化 · 保存期限 · data minimization
概念解释
去标识与保存期限控制(de-identification and retention limitation)要求移除研究不再需要的直接身份字段,降低间接组合重新识别的可能,并在用途结束后删除或进一步聚合资料。去标识不等于匿名:研究代码、精确时间、地点、罕见职业、声音或屏幕内容仍可能把记录连回个人。保存期限应由研究与复核需要推导,而不是默认永久保留。
机制
重新识别风险来自资料组合,而不只来自姓名。单个字段看似普通,精确时间、行为轨迹和小群体属性联结后可能唯一。资料保存越久,被泄露、用途漂移、权限累积和参与者处境变化的暴露窗口越大。将身份映射表与研究资料分离、减少粒度、限制访问和自动到期,可以同时降低攻击面与内部误用;仅把姓名替换成编号仍保留可链接性。
怎么研究
建立数据清单和流向图,逐字段记录用途、来源、敏感度、可链接性、访问角色与删除日期。用重识别威胁建模检查直接、推断、联结和成员身份风险,并测试导出、备份、转录和协作工具是否遵守同一策略。定期审计仍存资料是否对应有效研究目的,记录删除证明和无法删除的备份周期。正式匿名化强度需依据资料类型、攻击者能力和适用要求评估。
边界
保存过久会增加风险,但“删除什么”也需区分:若团队先销毁身份映射、却继续保留去标识资料,之后可能无法按参与者请求定向定位和移除该人的记录;这不同于真正删除研究资料,也不能反过来成为延长全部数据保留的理由。每类资料只应按研究必要性、获批方案及适用的法律或伦理依据保留到相应期限。小型质性研究即使删去姓名,逐字引语和背景细节仍易识别;公开数据集、模型参数和聚合统计也不能因“已发布”就假定无泄露风险。
怎么落地
- 收集前逐字段问“没有它能否回答问题”,删除仅因可能有用而收集的字段。
- 将联系信息和同意记录与研究资料分库存放,用受控映射连接。
- 设定原始、转录、分析与备份各自的删除日期和责任人,并自动提醒或执行。
- 用最小权限账户演练导出与删除;确认本地副本、云端版本、回收站和供应商备份都进入记录。