「赞美现在变成坏事了吗?」:比较大型语言模型与人类对职场性别微侵犯的理解差异
作者
AI 伦理、公平与问责算法公平与偏见科技伦理与批判性HCI大学教授与研究人员HCI 研究员隐私政策制定者
文献标题
“Are Compliments Bad Now?”: Comparing LLMs and Human Interpretations of Gender Microaggressions in the Workplace
出版信息
- 主题领域: 人类与大型语言模型(LLMs)对职场性别微侵害场景的解读。
- 关键词: 性别微侵害、职场歧视、大型语言模型、解读多样性、女性主义人机交互、情境知识、认知不公、人工智能偏见、解读敏感性、模糊性。
背景与问题
- 问题/挑战: 现有自动化系统在检测微侵害时,常无法考虑这些互动的模糊性和情境依赖性。尽管LLMs具有较高的检测率,但其解读可能与人类的解读不一致,尤其是那些受到歧视亲身经历影响的解读。
- 重要性: 微侵害对个人和组织有显著影响,包括倦怠和人员流失。有效的检测系统可以支持公平与包容的努力,但必须保留解读多样性,以避免边缘化非主流视角。
- 动机与相关研究: 之前的研究将微侵害检测视为文本分类问题,通常假设存在客观的标准答案。然而,微侵害的解读因社会身份和亲身经历而异。最新研究表明,LLMs反映了主流文化规范,这引发了它们是否适合社会敏感任务的担忧。本文旨在填补关于LLMs与人类在解读性别微侵害方面差异的研究空白。
解决方案
- 提出的方法: 采用混合方法研究,比较人类与LLMs对职场性别微侵害的解读,重点分析对十个对话场景的评分和理由。
- 创新点:
- 提供人类与LLMs在解读性别微侵害方面显著差异的实证证据。
- 识别LLMs与基于性别身份和亲身经历的人类子群之间的对齐与分歧模式。
- 引入分类敏感性(LLMs)与情境敏感性(人类)的区分。
- 提出保留自动化系统中解读多样性的设计启示。
- 流程与关键技术:
- 收集141名人类参与者(按性别身份和亲身经历分层)和7种LLM模型的数值评分(1–5 Likert量表)及开放文本理由。
- 场景包括8个包含性别微侵害的案例和2个中性对照案例,均改编自真实世界案例。
- 使用非参数统计测试对评分进行分析,并对理由进行反思性主题分析和描述性编码。
结果
- 具体发现:
- LLMs始终给出较高评分(4.7–5.0),且方差较小,而人类的解读多样性更高(3.04–4.73),受性别身份和亲身经历影响。
- 人类承认模糊性(理由中7.87%涉及模糊性)和情境因素,而LLMs几乎没有(仅0.18%涉及模糊性线索)。
- LLM的理由集中于概化的伤害机制描述(92.5%),而人类的理由通常基于具体的情境锚点。
- 相较基线的优势: LLMs虽然检测率高,但缺乏人类尤其是有微侵害亲身经历者所表现出的情境基础和解读细腻度。
- 实验/评估:
- 人类参与者(n=135)按性别和亲身经历分为六个子群。
- LLMs包括Claude、GPT和Gemini系列,在相同条件下进行评估。
- 统计测试(Kruskal–Wallis、Mann–Whitney)揭示了各组评分和理由的显著差异。
- 局限性与未来工作:
- 由于特定LLM版本、提示设计以及聚焦于基于性别的微侵害,研究的普适性有限。
- 某些子群样本量较小(如有亲身经历的男性)。
- 未来工作可探索交叉性微侵害、文化差异,以及针对情境敏感性对LLMs进行微调。
总结
本研究揭示了人类与LLMs在解读职场性别微侵害方面的根本差异。LLMs通过预定义类别一致性识别伤害,表现出分类敏感性,而人类通过情境和关系因素来判断,表现出情境敏感性。这些发现挑战了检测率越高敏感性越强的假设,并强调在自动化系统中保留解读多样性的重要性。本文提出了促进反思性对话、避免算法裁决取代人类判断的设计启示,推进了女性主义人机交互原则和批判性计算方法论的发展。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 71%
为善资助AI:呼唤有意义的参与
CHI '26· AI 伦理、公平与问责 +2
- 71%
表层偏见:头像外观如何影响AI招聘感知
CHI '26· AI 伦理、公平与问责 +2
- 67%
理解政策制定与人机交互之间的界限
CHI '19· 算法公平与偏见 +1
- 63%
生活在他们的乌托邦中:为什么算法系统产生荒谬的结果
CHI '21· AI 伦理、公平与问责 +2
- 63%
监管人工智能:美国州政策与人机交互的(不)对齐
CHI '26· AI 伦理、公平与问责 +3
- 63%
机器中的心灵?人工智能中意识感的跨学科认知
CHI '26· 大语言模型(LLM)的人机协作 +3
- 63%
从田野到算法:理解印度民族志学者对负责任AI的视角
CHI '26· AI 伦理、公平与问责 +3
- 63%
HCI 参与式人工智能正义:范围综述
CHI '26· 参与式设计(Participatory Design) +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790436
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
AI 伦理、公平与问责、算法公平与偏见、科技伦理与批判性HCI
work
职业/产业
大学教授与研究人员、HCI 研究员、隐私政策制定者
article
内容状态
已索引正文
hub
相关论文
8 篇相关论文