对我的置信区间有信心:数据用户如何参与隐私保护的维基百科数据研究

可解释人工智能(XAI)隐私设计与用户控制数据隐私感知与决策数据科学家与分析师AI/ML 研究员与工程师HCI 研究员

文献标题

'Having Confidence in My Confidence Intervals': How Data Users Engage with Privacy-Protected Wikipedia Data

出版信息

  • 主题领域: 数据用户与隐私保护数据集的交互。
  • 关键词: 差分隐私,舍入,隐私保护数据,维基百科,数据实用性,置信区间,数据文档,隐私与实用性权衡。

背景与问题

  • 问题/挑战: 像差分隐私(DP)和舍入这样的隐私保护技术会向数据集中引入噪声,但关于数据用户如何感知和使用这些噪声以及它们如何影响分析的研究仍然较少。
  • 重要性: 理解这些交互对于设计有效的文档和工具至关重要,这些文档和工具可以帮助数据用户在使用隐私保护数据时保持信任和实用性。
  • 动机与相关工作: 以往的研究主要关注数据主体的隐私保障和数据管理者的可用性,而对数据用户的体验关注较少。2020年美国人口普查和Facebook的Social Science One项目等高调数据发布事件突显了隐私保护与数据实用性之间的矛盾,强调了改进数据用户沟通和支持的必要性。

解决方案

  • 提出的方法: 通过任务驱动的情境调查,探索数据用户如何与两种隐私保护的维基百科数据集交互:一种使用舍入,另一种使用差分隐私。
  • 创新性:
    1. 针对隐私保护数据集设计的实证驱动文档。
    2. 比较用户对启发式(舍入)和形式化(DP)隐私方法的交互分析。
    3. 识别关于隐私-实用性权衡的误解以及计算置信区间的挑战。
    4. 提出改进隐私噪声数据集文档和工具的设计建议。
  • 程序和关键技术:
    • 在专家反馈的基础上开发数据集文档。
    • 通过任务驱动的情境调查和半结构化访谈对15名数据科学从业者进行研究。
    • 分析参与者与数据集的交互以及他们计算置信区间和解释隐私噪声的能力。

结果

  • 具体发现:
    • 参与者认为舍入更容易理解,但由于缺乏统计特性,其分析实用性较低。
    • DP数据支持更好的基于模拟的不确定性估计方法,但初始理解难度较大。
    • 大多数参与者在多个噪声数据点的置信区间计算上存在困难,特别是在聚合数据的情况下。
    • 一些参与者错误地将DP的较高实用性与较弱的隐私保护联系起来。
  • 相较基线的优势: DP在需要聚合或置信区间估计的任务中,被认为比舍入更具分析可行性和统计严谨性。
  • 实验/评估:
    • 数据集: 维基百科页面浏览数据(全局、舍入、DP)。
    • 任务: 噪声数据的置信区间估计和可能性计算。
    • 评估指标: 参与者的准确性、任务完成策略和定性反馈。
  • 局限性与未来工作:
    • 由于研究聚焦于维基百科数据集,其普适性有限。
    • 对隐私和实用性的关注可能影响了参与者的反馈。
    • 未来工作应探索更广泛的受众,开发置信区间计算工具,并研究其他情境下对噪声数据的感知。

总结

本研究探讨了数据用户如何与使用舍入和差分隐私(DP)的隐私保护维基百科数据集交互。参与者发现DP因其无偏性和高斯噪声特性更适合统计分析,但理解起来需要更多努力。舍入方法较简单,但对精确分析的实用性较低。许多参与者在多个噪声数据点的置信区间计算中遇到困难,并对隐私与准确性之间的关系存在误解。研究结果强调了改进文档、不确定性估计工具以及更好地传达隐私-实用性权衡的必要性。这些见解可为未来隐私保护数据发布的设计提供指导。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/221917/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791573
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
可解释人工智能(XAI)、隐私设计与用户控制、数据隐私感知与决策
work
职业/产业
数据科学家与分析师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文