预计人工智能法规将禁止机器学习模型在训练过程中使用敏感属性。然而,依赖于深度学习的最新自然语言处理(NLP)分类器作为黑盒系统运行,这使得检测和修复此类滥用变得复杂。NLP 中传统的偏见缓解方法旨在基于性别或种族等属性在不同群体之间实现相当的成绩,但未能解决依赖受保护属性的根本问题。为了部分解决这一问题,我们引入了 NLPGuard,这是一个减轻 NLP 分类器对受保护属性依赖的框架。NLPGuard 以未标记数据集、现有 NLP 分类器及其训练数据作为输入,生成一个显著减少对受保护属性依赖同时不损害准确性的修改后训练数据集。NLPGuard 应用于三个分类任务:识别恶意语言、情感分析和职业分类。我们的评估表明,当前的 NLP 分类器严重依赖受保护属性,高达23%的最具预测性的词汇与这些属性相关。然而,NLPGuard 有效地将这种依赖减少了高达79%,同时略微提高了准确性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/cscw/178742/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3686924
一眼看懂

论文快照

fact_check
dataset
来源
CSCW
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
work
职业/产业
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文