Q1.06.2De-identification and retention limitation设计研究

数据需去标识并限期保存

别名: 去标识化 · 保存期限 · data minimization

概念解释

去标识与保存期限控制(de-identification and retention limitation)要求移除研究不再需要的直接身份字段,降低间接组合重新识别的可能,并在用途结束后删除或进一步聚合资料。去标识不等于匿名:研究代码、精确时间、地点、罕见职业、声音或屏幕内容仍可能把记录连回个人。保存期限应由研究与复核需要推导,而不是默认永久保留。

机制

重新识别风险来自资料组合,而不只来自姓名。单个字段看似普通,精确时间、行为轨迹和小群体属性联结后可能唯一。资料保存越久,被泄露、用途漂移、权限累积和参与者处境变化的暴露窗口越大。将身份映射表与研究资料分离、减少粒度、限制访问和自动到期,可以同时降低攻击面与内部误用;仅把姓名替换成编号仍保留可链接性。

怎么研究

建立数据清单和流向图,逐字段记录用途、来源、敏感度、可链接性、访问角色与删除日期。用重识别威胁建模检查直接、推断、联结和成员身份风险,并测试导出、备份、转录和协作工具是否遵守同一策略。定期审计仍存资料是否对应有效研究目的,记录删除证明和无法删除的备份周期。正式匿名化强度需依据资料类型、攻击者能力和适用要求评估。

边界

保存过久会增加风险,但“删除什么”也需区分:若团队先销毁身份映射、却继续保留去标识资料,之后可能无法按参与者请求定向定位和移除该人的记录;这不同于真正删除研究资料,也不能反过来成为延长全部数据保留的理由。每类资料只应按研究必要性、获批方案及适用的法律或伦理依据保留到相应期限。小型质性研究即使删去姓名,逐字引语和背景细节仍易识别;公开数据集、模型参数和聚合统计也不能因“已发布”就假定无泄露风险。

怎么落地

  • 收集前逐字段问“没有它能否回答问题”,删除仅因可能有用而收集的字段。
  • 将联系信息和同意记录与研究资料分库存放,用受控映射连接。
  • 设定原始、转录、分析与备份各自的删除日期和责任人,并自动提醒或执行。
  • 用最小权限账户演练导出与删除;确认本地副本、云端版本、回收站和供应商备份都进入记录。

延伸

  • 同组Q1.06.1 知情同意需说明用途与退出权 · Q1.06.3 弱势群体研究需要额外保护
  • 相邻Q1.13 知情同意与研究伦理 · Q3.11 日志与埋点分析
  • 站内检索de-identification · data retention · re-identification risk

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/Q1.06.2