当刻板印象GTG:预测性文本建议对人与AI协作写作中性别偏见的影响
大语言模型(LLM)的人机协作AI 伦理、公平与问责算法公平与偏见AI/ML 研究员与工程师HCI 研究员社会学家与人类学家
文献标题
When Stereotypes GTG: The Impact of Predictive Text Suggestions on Gender Bias in Human-AI Co-Writing
出版信息
- 主题领域: 人机交互与预测文本系统中的偏见
- 关键词: 预测文本、性别偏见、刻板印象、人机协作、共同写作、语言模型、去偏、公平性、用户行为、社会技术系统
背景与问题
- 问题/挑战: 预测文本系统常常复制并放大社会偏见,包括性别刻板印象,这可能影响用户的写作并加剧代表性伤害。
- 意义: 理解带有偏见的预测文本建议如何影响人类写作,对于缓解偏见人工智能系统的社会影响至关重要,尤其是在广泛使用的应用(如手机键盘)中。
- 动机与相关研究: 先前研究已探讨语言模型中的偏见及其内在/外在影响,但未充分研究这些偏见对人机协作文本的影响。本论文通过研究带有偏见的建议如何影响与刻板印象相关的内容,填补这一空白。
解决方案
- 提出的方法: 研究人机协作写作场景中,预测文本系统提供与性别及相关特质相关的支持刻板印象或反刻板印象的单词建议。
- 创新点:
- 分析预测文本建议如何影响共同写作故事中角色的性别及刻板印象相关特质。
- 检验反刻板印象建议在减少偏见叙事中的有效性。
- 探索用户对建议的依赖程度及个体差异的接受行为。
- 评估人机协作中的社会技术公平性。
- 研究流程与关键技术:
- 进行混合方法研究,414名参与者在控制组(无建议)和处理组(带偏见建议)条件下写作故事。
- 使用Llama 2-Chat 7B生成预测文本建议,使用Llama 3 70B注释故事属性。
- 测量接受率、对建议的依赖程度,以及故事层面的性别和ABC特质(代理性、信念、共情)。
结果
- 具体发现:
- 反刻板印象建议增加了反刻板印象故事,但未能消除支持刻板印象的偏见;支持刻板印象的叙事仍占主导。
- 参与者显著更倾向于接受支持刻板印象的建议,而非反刻板印象建议。
- 即使完全采用反刻板印象建议,共同写作故事中的性别平等仍未实现。
- 参与者在决定是否接受反刻板印象建议时花费更多时间,表明存在隐性偏见。
- 相较基线的优势:
- 反刻板印象建议相比控制条件,导致反刻板印象内容的边际增加。
- 支持刻板印象建议生成的故事与无建议条件下的故事相似,突显了人类偏见的持续性。
- 实验/评估:
- 涉及性别和ABC特质的七种写作场景(如总统的仁慈、医生的自信)。
- 使用大语言模型注释和人工验证对故事属性及单词层面依赖进行定量分析。
- 通过统计测试比较各条件下的接受率和故事分布。
- 局限性与未来工作:
- 仅限于单词建议及英语场景。
- 结果可能无法推广至其他文化或语言环境。
- 未来工作可探索交互层面的干预措施,以鼓励对偏见的反思,以及预测文本系统的长期影响。
总结
本研究探讨了带有偏见的预测文本建议如何影响人机协作写作的故事,重点关注性别及刻板印象相关特质。反刻板印象建议增加了反刻板印象叙事,但不足以抵消支持刻板印象的偏见。参与者更倾向于接受支持刻板印象的建议,即使在最大程度采用反刻板印象建议的条件下,故事中的性别平等仍未实现。研究结果突显了技术去偏的局限性,并建议实现人机协作中的公平性需要同时关注模型设计和用户行为。未来研究应探索交互层面的干预措施,以缓解共同写作场景中的偏见。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 86%
LLM在价值导向话题的建设性论证中使价值观同质化
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
视角问题:对比人类和大型语言模型在微妙性别歧视主观决策中的论证
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
超越微软和孟山都:去化计算中的单作隐喻
CHI '26· AI 伦理、公平与问责 +2
- 71%
TALES:LLM生成故事中文化表征的分类学与分析
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
走向实践中的公平性:评估公平机器学习工具包的实践者导向标准
CHI '21· AI 伦理、公平与问责 +1
- 67%
陪审团学习:将不同意见整合到机器学习模型中
CHI '22· AI 伦理、公平与问责 +1
- 67%
有能力但不道德?比较AI和人类专家在道德决策中的合作
CHI '22· AI 伦理、公平与问责 +1
- 67%
脱离上下文:调查“人工智能作为服务”的偏见和公平性问题
CHI '23· AI 伦理、公平与问责 +1
- 67%
这目前是杂乱无章的:考察AI/ML从业者在负责任的AI价值观共同生产过程中的挑战
CHI '23· AI 伦理、公平与问责 +1
- 67%
自然语言处理的“殖民冲动”:孟加拉语情感分析工具及其基于身份的偏见的审核
CHI '24· AI 伦理、公平与问责 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790733
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 伦理、公平与问责、算法公平与偏见
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、社会学家与人类学家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文