TALES:LLM生成故事中文化表征的分类学与分析
作者
大语言模型(LLM)的人机协作AI 伦理、公平与问责低资源语言与数字包容AI/ML 研究员与工程师HCI 研究员社会学家与人类学家
文献标题
TALES: A Taxonomy and Analysis of Cultural Representations in LLM-generated Stories
出版信息
- 主题领域: AI生成叙事中的文化表现
- 关键词: 文化误表述、大型语言模型、叙事、分类法、印度文化、多语言评估、生成式AI、文化能力、印度语言、AI评估
背景与问题
- 问题/挑战: 大型语言模型(LLMs)在开放式生成任务(如叙事)中经常误表述多样化的文化身份。现有评估缺乏框架来评估文化适当性和误表述的细微差别。
- 重要性: AI生成叙事中的误表述可能会延续刻板印象、不准确性,并对边缘化社区造成伤害,尤其是在非西方背景下。解决这一问题对于公平AI开发至关重要。
- 动机与相关研究: 之前的研究主要通过数据集和量化指标关注AI的文化能力,但很少涉及开放式生成任务。评估通常局限于西方背景或狭窄的文化代理。本研究以印度文化多样性为重点,开发了一个文化误表述分类法以填补这些空白。
解决方案
- 提出的方法: TALES(Taxonomy and Analysis of culture representation in LLM-generated Stories),一个以社区为中心的框架,用于评估LLM生成叙事中的文化误表述。
- 创新点:
- 开发了TALES-Tax,一个包含七类文化误表述的分类法。
- 对六种LLM在英语和13种印度语言中的文化误表述进行了大规模人工评估。
- 创建了TALES-QA,一个用于评估模型文化知识的问题库。
- 过程与关键技术:
- 通过焦点小组(N=9)和问卷调查(N=15)识别误表述类别。
- 通过参与者反馈的反思性主题分析开发了TALES-Tax。
- 使用来自印度71个地区的108名标注员评估了六种LLM,收集了540个故事中的2,925个标注。
- 将误表述标注转化为1,683个独立问题,形成TALES-QA,并由人工专家验证。
结果
- 具体发现:
- 88%的LLM生成故事包含文化误表述。
- 每个故事平均误表述数量为5.42(大约每五句话就有一个误表述)。
- 模型回答文化知识问题的准确率为英语76.9%,印度语言59.8%。
- 相较基线的优势:
- TALES-Tax提供了一个结构化框架,用于评估文化误表述,填补了以往研究的空白。
- TALES-QA揭示了模型文化知识与生成能力之间的差异。
- 实验/评估:
- 评估了六种LLM生成的故事,包括GPT 4.1、Gemini 2.5 Pro以及四种开源模型。
- 使用Hofstede的文化洋葱模型设计了针对符号、英雄、仪式和价值观的提示。
- 分析了不同语言、地区和文化特定项目(CSIs)中的误表述频率。
- 局限性与未来工作:
- 焦点小组和问卷调查仅使用英语进行,可能遗漏了其他语言中的细微差别。
- 评估集中于印度文化背景,尚未探索其对全球文化的广泛适用性。
- 提示设计可能影响观察到的误表述率,未来工作可以探索更丰富的提示和外部知识整合。
总结
TALES引入了一个分类法(TALES-Tax)和评估框架,用于分析LLM生成叙事中的文化误表述,重点关注印度文化多样性。通过大规模人工评估,研究揭示了广泛存在的误表述,尤其是在印度语言和较少被关注的地区。TALES-QA问题库表明,模型虽然具备文化知识,但在生成任务中未能有效应用。这项工作强调了提高LLM文化能力的必要性,并为多语言和文化敏感型AI系统的未来研究提供了工具。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790519
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 伦理、公平与问责、低资源语言与数字包容
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、社会学家与人类学家
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文