迷失于适度:商业内容审核API如何过度和适度审核针对群体的仇恨言论和语言变体
作者
AI 伦理、公平与问责算法透明度与可审计性暗黑模式(Dark Patterns)识别内容审核与平台治理隐私政策制定者内容治理与平台合规团队HCI 研究员
研究背景与问题
- 发现的问题或挑战: 商业内容审核 API 在处理网上仇恨言论时存在两种显著失误:过度审核(误将合法内容标记为仇恨言论)和不足审核(未能检测出实际的仇恨言论)。这些问题尤其对使用身份标签(例如“黑人”或“同性恋”)的内容影响显著。对具体目标群体和语言变体的审核表现存在差异,这对少数群体尤其不利。
- 重要性: 虚假的仇恨言论标记会压制合法言论,削弱公众讨论的多样性,同时未检测到的仇恨言论会加剧社交媒体上的毒性和对受害群体的伤害。这些问题对 LGBTQIA+、犹太人、穆斯林等少数群体的公平交流环境造成威胁,影响用户信任。
- 相关工作: 很多研究已探讨开源 NLP 模型中的问题,包括它们对某些目标群体的丑化和对隐含仇恨言论的不足检测。然而,针对商业 API 的系统评估仍然稀缺,API 的“黑箱”性质限制了相关研究的透明性。
解决方案
- 提出的方法或解决方案: 论文提出了一个新的框架,用于审核商业内容审核 API,将重点放在五个常用的服务(如 OpenAI、Google、Amazon 等)上,通过分析超过五百万条查询和四个基准数据集以评估其性能。
- 创新之处:
- 提供了首个可以复现的框架,适用于“黑箱” NLP 模型审核。
- 创造了三项实验(性能对比、反事实公平性分析和 SHAP 可解释性分析)深入探讨各 API 的功能性错误和偏差来源。
- 不仅限于简单的错误率统计,还结合了语料分析,解释模型的语言偏好(如对于特定群体标识词的过度依赖)。
- 实施步骤:
- 使用五个商用内容审核 API,运行超过 500 万条查询以收集数据。
- 利用四个基准数据集(如 ToxiGen 和 HateXplain),审核不同类别的仇恨言论和目标群体表现。
- 设计三个实验:针对 API 的总体与目标群体性能分析、扰动敏感性分析以检测群体偏见,以及 SHAP 方法解析模型对不同词汇的偏好。
研究成果
- 具体成果: 发现所有 API 都通过身份标签(如“黑”或“同性恋”)预测仇恨言论,这导致:
- 对 LGBTQIA+ 群体和隐晦仇恨言论的不足审核。
- 对再利用的侮辱词(如黑人群体 reclaim 的“n*gger”)和辩驳言论的过度审核。
- 优势: OpenAI 和 Amazon 的性能稍优于其他服务。这些服务在显性仇恨言论上表现较佳,但仍存在隐含言论检测不足的问题。
- 实验或评估结果: 批量分析显示,Google Natural Language API 在少数群体上表现最差,频繁发生误删情况(误删率高达 99%)。SHAP 解释显示,许多模型对某些少数群体特定词汇的信号过于敏感,导致错误标记。
- 局限性与未来方向:
- 局限性: 由于黑箱性质,无法访问 API 的权重或训练数据;高查询成本限制了更大规模的审查;且现有基准数据标签可能未完全准确。
- 未来方向: 研究应该扩展至非英语内容审核,探索其它形式内容(如图像、音频)审核表现,并开发更高效的审核方法以降低成本。同时,对 API 中的多语言支持和含义细化提出明确要求。
总结
这项研究通过系统性的框架和实验,揭示了商业内容审核 API 的性能缺陷及其对特定群体的负面影响,强调了透明性和审核必要性的重要性。论文呼吁内容审核服务商优化算法设计并提供更多说明,建议决策者增加第三方审计的法律支持和责任义务。这一工作为未来的内容审核系统发展提供了理论支持和实践工具。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 商业内容审核API在处理仇恨言论时有哪些具体的功能性缺陷?分类: 在线内容审核中的公平性、偏见与文化适应性同类问题arrow_forward
- 这些API在审核各目标群体和语言变体内容时表现是否存在偏差?分类: 在线内容审核中的公平性、偏见与文化适应性同类问题arrow_forward
- 如何设计一个可复现的框架对'黑箱'NLP模型进行性能和公平性审计?分类: 在线内容审核中的公平性、偏见与文化适应性同类问题arrow_forward
lightbulb
现实痛点
1- 少数群体的合法表达易被内容审核误删,而仇恨言论常被漏检。分类: 在线内容审核中的公平性、偏见与文化适应性同类问题arrow_forward
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713998
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
AI 伦理、公平与问责、算法透明度与可审计性、暗黑模式(Dark Patterns)识别、内容审核与平台治理
work
职业/产业
隐私政策制定者、内容治理与平台合规团队、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文