TALES:LLM生成故事中文化表征的分类学与分析

大语言模型(LLM)的人机协作AI 伦理、公平与问责低资源语言与数字包容AI/ML 研究员与工程师HCI 研究员社会学家与人类学家

文献标题

TALES: A Taxonomy and Analysis of Cultural Representations in LLM-generated Stories

出版信息

  • 主题领域: AI生成叙事中的文化表现
  • 关键词: 文化误表述、大型语言模型、叙事、分类法、印度文化、多语言评估、生成式AI、文化能力、印度语言、AI评估

背景与问题

  • 问题/挑战: 大型语言模型(LLMs)在开放式生成任务(如叙事)中经常误表述多样化的文化身份。现有评估缺乏框架来评估文化适当性和误表述的细微差别。
  • 重要性: AI生成叙事中的误表述可能会延续刻板印象、不准确性,并对边缘化社区造成伤害,尤其是在非西方背景下。解决这一问题对于公平AI开发至关重要。
  • 动机与相关研究: 之前的研究主要通过数据集和量化指标关注AI的文化能力,但很少涉及开放式生成任务。评估通常局限于西方背景或狭窄的文化代理。本研究以印度文化多样性为重点,开发了一个文化误表述分类法以填补这些空白。

解决方案

  • 提出的方法: TALES(Taxonomy and Analysis of culture representation in LLM-generated Stories),一个以社区为中心的框架,用于评估LLM生成叙事中的文化误表述。
  • 创新点:
    1. 开发了TALES-Tax,一个包含七类文化误表述的分类法。
    2. 对六种LLM在英语和13种印度语言中的文化误表述进行了大规模人工评估。
    3. 创建了TALES-QA,一个用于评估模型文化知识的问题库。
  • 过程与关键技术:
    • 通过焦点小组(N=9)和问卷调查(N=15)识别误表述类别。
    • 通过参与者反馈的反思性主题分析开发了TALES-Tax。
    • 使用来自印度71个地区的108名标注员评估了六种LLM,收集了540个故事中的2,925个标注。
    • 将误表述标注转化为1,683个独立问题,形成TALES-QA,并由人工专家验证。

结果

  • 具体发现:
    • 88%的LLM生成故事包含文化误表述。
    • 每个故事平均误表述数量为5.42(大约每五句话就有一个误表述)。
    • 模型回答文化知识问题的准确率为英语76.9%,印度语言59.8%。
  • 相较基线的优势:
    • TALES-Tax提供了一个结构化框架,用于评估文化误表述,填补了以往研究的空白。
    • TALES-QA揭示了模型文化知识与生成能力之间的差异。
  • 实验/评估:
    • 评估了六种LLM生成的故事,包括GPT 4.1、Gemini 2.5 Pro以及四种开源模型。
    • 使用Hofstede的文化洋葱模型设计了针对符号、英雄、仪式和价值观的提示。
    • 分析了不同语言、地区和文化特定项目(CSIs)中的误表述频率。
  • 局限性与未来工作:
    • 焦点小组和问卷调查仅使用英语进行,可能遗漏了其他语言中的细微差别。
    • 评估集中于印度文化背景,尚未探索其对全球文化的广泛适用性。
    • 提示设计可能影响观察到的误表述率,未来工作可以探索更丰富的提示和外部知识整合。

总结

TALES引入了一个分类法(TALES-Tax)和评估框架,用于分析LLM生成叙事中的文化误表述,重点关注印度文化多样性。通过大规模人工评估,研究揭示了广泛存在的误表述,尤其是在印度语言和较少被关注的地区。TALES-QA问题库表明,模型虽然具备文化知识,但在生成任务中未能有效应用。这项工作强调了提高LLM文化能力的必要性,并为多语言和文化敏感型AI系统的未来研究提供了工具。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223387/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790519
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 伦理、公平与问责、低资源语言与数字包容
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、社会学家与人类学家
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文