利用人工智能识别、解释和纠正歧视性语言
大语言模型(LLM)的人机协作AI 伦理、公平与问责认知障碍与神经多样性(自闭症、ADHD、阅读困难)包容性设计(Inclusive Design)精神科医生与心理咨询师辅助技术专家HCI 研究员
文献标题
Identifying, Explaining, and Correcting Ableist Language with AI
出版信息
- 主题领域: 基于人工智能的文本中残障歧视语言检测与纠正。
- 关键词: 残障歧视, AI注释, 包容性语言, 残障正义, GPT-4o, 偏见检测, 叙事分析, 人工与AI比较, 文化能力, 写作工具。
背景与问题
- 问题与挑战: 微妙的残障歧视语言仍然广泛存在且难以识别,常被一般仇恨言论工具和传播者忽视。目前的框架缺乏适应复杂语境的能力,并且过度依赖人工专业知识,难以规模化。
- 重要性: 解决残障歧视语言问题对于促进包容性沟通以及减少对残障群体在日常写作、新闻报道和专业场景中的伤害至关重要。
- 动机与相关研究: 先前研究强调了人工智能倾向于复制残障歧视规范以及检测隐性伤害的难题。尽管自动化工具在解决其他偏见(如种族主义、性别歧视)方面表现出一定潜力,但其在残障歧视领域的应用仍未被充分探索。本文基于现有研究评估AI在识别、解释和纠正残障歧视语言方面的作用,并将其表现与人工注释进行比较。
解决方案
- 提出的方法: 通过两部分研究评估GPT-4o在注释虚构叙事中的残障歧视语言的能力,并将AI生成的注释与来自残障群体的人工众包注释进行比较。
- 创新点:
- 创建首个基于真实经验的细致残障歧视注释数据集。
- 对比AI生成与人工生成的注释,分析一致性、清晰度和文化深度之间的权衡。
- 为处理文化敏感语言的AI系统和写作工具设计指导原则。
- 研究流程与关键技术:
- 研究1: 使用GPT-4o生成包含微妙残障歧视的虚构故事,并通过残障群体试验参与者验证。收集人工注释以识别、解释和纠正句子及段落层面的残障歧视语言。
- 研究2: 比较AI生成的注释(通过链式提示生成)与研究1中合成的人工基线注释。调查108名残障群体参与者以评估注释质量、认可度和偏好。
结果
- 具体发现:
- AI与人工注释在句子层面的平均一致率为72.3%。
- 参与者整体更倾向于AI注释(43.9%),而非人工注释(23.4%),理由包括清晰性、一致性和易于理解的格式。
- 人工注释因其文化基础和倡导导向的框架受到重视,但因措辞密集和解释与纠正逻辑不一致受到批评。
- 相较基线的优势:
- AI注释因其简洁、中立和可操作性反馈受到赞誉,而人工注释则在情感共鸣和文化批判方面表现突出。
- 实验与评估:
- 研究1涉及110名参与者对AI生成的虚构故事进行注释,涵盖七个残障类别。研究2调查了108名参与者,通过Likert量表和定性反馈比较AI与人工注释。
- 评估指标包括一致率、偏好排名以及参与者反馈的主题编码。
- 局限性与未来工作:
- 结果可能无法推广至非虚构或专业写作场景。
- 参与者群体仅限于接受过DEI培训的大学教育者,未完全代表更广泛的残障群体。
- 未来工作应扩大数据集规模,测试长期教育影响,并探索其他偏见形式的应用。
总结
本文研究了AI在识别、解释和纠正残障歧视语言中的作用,比较了GPT-4o注释与来自残障群体的人工注释。结果显示两者在准确性上相当,但各有优势:AI注释在清晰性和一致性方面表现突出,而人工注释提供了文化深度和倡导导向的框架。参与者整体更偏好AI注释,突显其作为偏见教育可扩展工具的潜力。本文贡献包括一个细致的残障歧视数据集、人类与AI注释权衡的实证洞察,以及包容性写作工具的设计指导原则。未来工作旨在扩展数据集规模,测试更广泛的应用,并优化AI系统以平衡清晰性与文化敏感性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790533
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 伦理、公平与问责、认知障碍与神经多样性(自闭症、ADHD、阅读困难)、包容性设计(Inclusive Design)
work
职业/产业
精神科医生与心理咨询师、辅助技术专家、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文