Black LLMirror:用户(自我)对大语言模型使用黑人美式英语交互的感知研究
大语言模型(LLM)的人机协作AI 伦理、公平与问责算法公平与偏见HCI 研究员认知科学家
文献标题
Black LLMirror: User (Self) Perceptions in Black American English Interactions with LLMs
出版信息
- 主题领域: 用户对使用非标准方言(如黑人美国英语,BAE)的大型语言模型(LLMs)的感知及其自我感知。
- 关键词: 黑人美国英语,方言镜像,大型语言模型,用户感知,自尊,语言转换,个性化,语音交互,文本交互,语言偏见。
背景与问题
- 问题/挑战: 现有的LLMs通常无法有效处理非标准方言,如BAE,导致用户不满、不适当的输出或被认为是文化挪用。此前研究主要集中于静态或单轮交互,忽视了对用户自我感知的影响。
- 重要性: 理解BAE使用者如何感知并回应使用其方言的LLMs对于设计包容且有效的语言技术至关重要,尤其考虑到BAE的历史和文化意义。
- 动机与相关工作: 先前研究记录了NLP系统对BAE的偏见、用户对方言表现不足的不满以及与偏见系统交互的心理影响。然而,这些研究未探讨多轮交互或对用户自我感知的影响,这正是本文试图解决的研究空白。
解决方案
- 提出的方法: 本研究调查BAE使用者对BAE和标准美国英语(SAE)生成的LLMs在文本和语音交互中的感知,重点关注模型感知和自我感知。
- 创新点:
- 研究与BAE和SAE生成的LLMs的多轮交互。
- 测量用户自我感知和模型感知在不同交互方式中的表现。
- 结合开放式用户反馈的定性分析。
- 使用定量和基于感知的方法验证LLM输出中的BAE方言密度。
- 研究流程与关键技术:
- 通过Prolific招募参与者(n=619),筛选其BAE能力,并随机分配参与者与BAE或SAE生成的LLM进行文本或语音交互。
- 在交互前后进行问卷调查,测量自我感知(自尊、自我意识、情感)和模型感知(温暖、能力、信任、社交性、可理解性)。
- 对开放式反馈进行主题分析,以捕捉用户的细致反应。
- 使用参与者感知和基于XGBoost的方言密度预测器验证LLM输出中的BAE方言密度。
结果
- 具体发现:
- 基于文本的BAE交互显著提高了参与者的自尊(d=0.116,p=0.014)。
- 基于语音的BAE交互略微增加了负面情绪和自我意识,但未达到显著水平。
- 语音中的BAE模型在温暖(p=0.012)和能力(p=0.01)评分上显著低于SAE模型。
- 参与者在与BAE模型交互时报告了更高的BAE使用率,这与方言密度分析一致(d=0.303,p=0.015)。
- 相较基线的优势: 研究揭示了方言镜像的细致影响,表明BAE模型可以减少语言转换的感知需求,但可能引发混合或两极化反应。
- 实验/评估:
- 两部分问卷调查,随机分配参与者与BAE或SAE模型进行文本或语音交互。
- 统计测试(配对t检验、Mann-Whitney U检验)和开放式文本响应的主题分析。
- 使用参与者感知和计算模型验证BAE方言密度。
- 局限性与未来工作:
- 由于样本量限制,研究未能充分进行子组分析或领域特定的洞察。
- 某些人口群体(如女性、30-39岁参与者)的过度代表可能影响了研究结果。
- 未来研究可探索长期交互、其他方言或更细化的人口统计影响。
总结
本研究探讨了BAE使用者在与BAE或SAE生成的LLMs进行文本和语音多轮交互时的自我感知和模型感知。基于文本的BAE交互显著提升了自尊,而基于语音的BAE交互在温暖和能力评分上较低。参与者在与BAE模型交互时报告了减少语言转换的情况,但定性反馈显示反应两极化,从肯定到冒犯不一。这些发现强调了默认方言镜像的风险,并突出了用户中心设计原则的重要性,例如保守的个性化探测和明确的用户反馈渠道。研究结果为LLMs如何更好地服务语言边缘化群体提供了重要见解。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 80%
作为AI语言模型,我无法:“调查LLM对用户请求的否认”
CHI '24· 大语言模型(LLM)的人机协作 +1
- 80%
人类与日常AI系统交互中的责任归属
CHI '25· AI 伦理、公平与问责 +1
- 67%
影响算法决策中感知公平性的因素:算法结果、开发程序和个人差异
CHI '20· AI 伦理、公平与问责 +1
- 67%
看!它是计算机程序!它是算法!它是人工智能!:术语是否影响人类对算法决策系统的感知和评估
CHI '22· AI 伦理、公平与问责 +2
- 67%
展望和理解内省AI的方向:使用Meta.Aware探索设计空间
CHI '23· AI 伦理、公平与问责 +2
- 67%
生成式AI与感知伤害:谁被怀疑使用了大语言模型?
CHI '25· 大语言模型(LLM)的人机协作 +2
- 60%
AI驱动的调解策略用于在线辩论中的观众去极化
CHI '24· 大语言模型(LLM)的人机协作 +2
- 60%
包容性、控制权和所有权在工作场所人工智能中介沟通中的作用
CHI '24· 大语言模型(LLM)的人机协作 +2
- 60%
持续的人在环优化
CHI '25· 大语言模型(LLM)的人机协作
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791111
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 伦理、公平与问责、算法公平与偏见
work
职业/产业
HCI 研究员、认知科学家
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文