NLPGuard:一种减轻 NLP 分类器使用受保护属性的框架
预计人工智能法规将禁止机器学习模型在训练过程中使用敏感属性。然而,依赖于深度学习的最新自然语言处理(NLP)分类器作为黑盒系统运行,这使得检测和修复此类滥用变得复杂。NLP 中传统的偏见缓解方法旨在基于性别或种族等属性在不同群体之间实现相当的成绩,但未能解决依赖受保护属性的根本问题。为了部分解决这一问题,我们引入了 NLPGuard,这是一个减轻 NLP 分类器对受保护属性依赖的框架。NLPGuard 以未标记数据集、现有 NLP 分类器及其训练数据作为输入,生成一个显著减少对受保护属性依赖同时不损害准确性的修改后训练数据集。NLPGuard 应用于三个分类任务:识别恶意语言、情感分析和职业分类。我们的评估表明,当前的 NLP 分类器严重依赖受保护属性,高达23%的最具预测性的词汇与这些属性相关。然而,NLPGuard 有效地将这种依赖减少了高达79%,同时略微提高了准确性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3686924
一眼看懂
fact_check论文快照
dataset
来源
CSCW
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
—
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文