Z8.04.4Data provenance设计研究
数据可见不等于数据可核查,原始来源同样重要
别名: 数据血缘 · 可核查性 · 可验证性
概念解释
公布一张加工过的图表、一个汇总后的结论,和提供可核查的原始数据,是两回事。可核查意味着第三方能够重做分析:拿到原始粒度的数据、知道口径与处理步骤、从而验证结论是不是数据的必然产物。支撑这个性质的元信息叫数据血缘(data provenance)——数据从哪里来、经过哪些加工、每步做了什么选择。
只有成品没有来源时,「透明」其实没有发生:公众看到的仍是断言,只是断言被画成了图表。
机制
为什么成品图表不构成可核查?因为从原始数据到成品之间,每一步加工都埋着自由度:统计口径选哪个(户籍人口还是常住)、聚合到什么粒度(区还是街道)、时段怎么切(自然年还是财年)、异常值如何清洗、哪个月的数据被排除。这些选择每一个都能改变结论的方向,而它们在成品图表上完全不可见。
只发布结论等于只发布一次选择的结果,选择本身被藏起来。核查者无法区分「数据真的支持这个结论」和「换一种同样合理的口径结论就反转」。开放数据研究把口径与质量列为首要障碍正是因为这个:不可重做的分析在证据意义上不存在。
怎么研究
- 开放数据质量与谱系研究:对门户数据集的元数据完备度(口径、采集方法、更新记录)做系统评估,考察谱系信息与第三方重用率的关系。
- 数据新闻实践研究:跟踪数据新闻编辑室「分析可重复」的实践——附上数据处理脚本与原始数据,读者可复算。
- 重分析对照研究:同一决策结论,请独立团队用公开的原始数据重做分析,比较结论一致性——一致性与数据血缘完备度的关系。
方法论注意点:核查能力的测量要用「任务完成」而非「资料在场」——不是数元数据字段填了几个,而是看一个外部团队能否真的从公开材料复现出同样的数字。复现失败的位置就是谱系缺口的位置。
边界
- 隐私限制原始粒度的公开。 个体层面的数据不能放;但粒度聚合到街道级可能抹掉小群体的处境。粒度是权衡后的决定,且应当被写明——含糊的「因隐私不予公开」经常被用作不公开的挡箭牌。
- 成本与安全例外存在被滥用空间。 商业合同、安防细节确有例外理由,但例外范围应逐项列明并接受审视,笼统的例外条款等于豁免权。
- 原始数据不能自我证明质量。 血缘信息由发布方自己填写,恶意方可以伪造谱系——跨机构的交叉核验(两个独立采集源互相印证)是更硬的约束。
怎么落地
- 每个发布的数据集附元数据文件:采集方法、口径定义、已知缺陷、更新频率、责任部门。
- 提供从原始到成品的处理说明——理想是附处理脚本,至少是逐步的口径记录;成品图表链接到它所用的数据集版本。
- 数据集版本化:更新留痕,历史版本可取——用旧版本做的分析在数据更新后应仍可复现。
- 验证办法:抽取一份已发布的成品结论,让外部团队仅凭公开材料复现其中的关键数字。复现不出来的部分,逐项补谱系信息,直到复现成功。