黄金标准还是镀金?CSAM 删除中三重验证的人类实践

荣誉提名
在线骚扰与反制工具内容审核与平台治理警察与紧急服务人员内容治理与平台合规团队

文献标题

Gold Standard or Gold-Plated? Human Practices of Triple Verification in CSAM Takedown

出版信息

  • 主题领域: CSAM分类与移除中的验证实践。
  • 关键词: CSAM,三重验证,评审者间一致性,内容审核,哈希数据库,盲审与非盲审,心理负担,AI在审核中的应用,系列识别,《数字服务法案》。

背景与问题

  • 问题/挑战: 当前关于CSAM分类的验证程序,特别是三重验证的研究较少,对这些程序的实施方式、对准确性和效率的影响以及专家面临的挑战缺乏深入理解。
  • 重要性: 准确的CSAM分类对发布通知与移除(NTD)请求、维护哈希数据库以及确保法律合规至关重要。错误分类可能导致严重后果,包括受害者持续受害或错误地将内容纳入数据库。
  • 动机与相关工作: 以往研究主要关注CSAM检测工具和用户对自动扫描的看法,但未深入探讨验证程序或其操作化过程。法医学研究虽然分析了评审者间的一致性,但缺乏对实际工作流程、专业评审人员以及盲审与非盲审等不同条件的洞察。

解决方案

  • 提出的方法: 采用混合方法研究,包括专家访谈、评审者间一致性实验以及焦点小组讨论,以调查验证实践、专家看法以及投票条件对CSAM分类的影响。
  • 创新点:
    1. 绘制不同组织的验证程序图谱。
    2. 在盲审与非盲审条件下,实证评估评审者间的一致性。
    3. 识别专家分歧中的关键挑战,包括系列识别和年龄估算。
    4. 提出适应性验证实践,以平衡准确性、效率和评审者的身心健康。
  • 流程与关键技术:
    1. 对来自七个组织的14位专家进行半结构化访谈,以了解工作流程和看法。
    2. 与荷兰国家警察专家合作设计评审者间一致性实验,分析2,031张图像/视频在盲审与非盲审条件下的表现。
    3. 举办焦点小组讨论,探讨分歧原因并将实验结果置于背景中进行分析。

结果

  • 具体发现:
    • 非盲审条件下的一致性更高(Cohen’s Kappa:0.893 vs. 盲审条件下的0.670)。
    • 视频的分类可靠性高于图像(盲审条件下视频的Kappa:0.812 vs. 图像的Kappa:0.601)。
    • 三重验证相比双重验证揭示了8%的案例分歧。
  • 相较基线的优势:
    • 三重验证揭示了残留的不确定性,并在模糊案例中提高了准确性。
    • 非盲审工作流程增强了一致性,但可能引入偏差。
  • 实验/评估:
    • 数据集:荷兰国家警察专家审核的2,031个与CSAM相关的项目。
    • 指标:评审者间一致性的Cohen’s Kappa,原始一致性百分比。
    • 条件:盲审与非盲审投票、投票顺序的影响、文件类型差异。
  • 局限性与未来工作:
    • 访谈参与者的多样性有限(例如,未收到NCMEC的回复)。
    • 研究结果特定于荷兰的法律和操作背景。
    • 未来工作应探索AI在减轻工作负担和处理合成CSAM中的作用。

总结

本研究调查了CSAM验证的实践与挑战,重点分析三重验证作为防止错误分类的保障措施。通过访谈、实验和焦点小组讨论,作者发现验证实践差异显著,非盲审工作流程提高了一致性但引发了偏差担忧。关键挑战包括系列识别、年龄估算以及评审者的心理压力。研究结果突出了准确性、效率与评审者身心健康之间的权衡,并建议采用适应性验证实践,同时谨慎整合AI以支持人工监督。这些洞察有助于改善CSAM治理,确保验证流程的伦理性与可扩展性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222850/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791039
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
3 位作者
sell
研究子方向
在线骚扰与反制工具、内容审核与平台治理
work
职业/产业
警察与紧急服务人员、内容治理与平台合规团队
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文