偏见与误解:探究文本到图像模型中的文化代表性

AI 伦理、公平与问责算法公平与偏见AI/ML 研究员与工程师律师与法律研究员社会学家与人类学家

文献标题

Partiality and Misconception: Investigating Cultural Representativeness in Text-To-Image Models

文献信息

  • 主题领域: 文本生成技术与跨文化偏见
  • 关键词: 文字生成图像, 文化代表性, 文化偏见, 跨文化分析, 模型训练数据

研究背景与问题

  • 作者发现的问题或挑战:
    • 当前的文本生成图像(T2I)模型在生成文化相关图像时存在偏向性和错误表达,这些问题可能导致全球文化的不公平代表性。
    • 尽管有一些研究关注了种族、性别和年龄偏见,关于文化代表性的研究仍较少,尤其是全球文化的公平性和准确性问题。
  • 重要性:
    • 模型输出的文化图像可能加剧社会中已经存在的文化偏见,进一步边缘化处于劣势的文化群体。
    • 文化误表可能传播错误的信息,导致误解,并破坏全球文化的理解与交流。
  • 研究动机与相关工作:
    • 近期生成模型在精度和表现力方面取得重大进展,如DALL-E v2和Stable Diffusion,但研究发现这些模型在生成内容时存在明显的文化偏差。
    • 作者希望深入了解这些偏差及其产生原因,并提供改进的建议。

解决方案

  • 提出的解决方案:
    • 引入文化群组和文化主体两个维度,量化评价T2I模型在文化代表性上的表现。
    • 提出混合机器和人工的方法评估T2I模型。
    • 开发全球文化对象基准数据集(UCOGC),涵盖来自30个国家的多样文化对象。
  • 创新之处:
    • 提出多维度的文化代表性分析框架,对全球10个文化群组和9类文化主体进行分析。
    • 对生成图像进行特征提取,并与真实图像数据集进行对比,衡量生成内容的准确性。
  • 实施步骤及关键技术:
    • 使用三种T2I模型(DALL-E v2,Stable Diffusion v1.5和v2.1),生成文化代表性的相关图像。
    • 构建特定国家和文化对象相关的文本提示,在所有模型中生成大量图像供分析。
    • 采用ResNet和ViT进行迁移学习,分析模型的生成偏差。
    • 通过混合评价方法(包括量化指标如FID/KID和人工评价)进行可靠性检查。

研究成果

  • 具体成果:
    • 提出并定义了文化群组及文化主体两个分析维度。
    • 设计并验证了基准数据集UCOGC,评估T2I模型在文化表达上的表现。
    • 生成并分析了超过19万张图片,与基准数据集进行对比,揭示了模型在文化表达上的显著偏差。
  • 相比现有解决方案的优势:
    • 全面覆盖文化的物质(例如服装、建筑等)和非物质(例如表演、节庆活动等)对象。
    • 评估方法结合定量指标和人工评分,确保结果的可靠性和人类感知一致性。
  • 实验或评估结果:
    • 在文化分布上不公平:劣势国家的文化较少被体现,例如南亚和非洲文化的占比显著低于实际人口比例。
    • 在多样性上存在差异:一些国家的生成内容较为单一,降低了文化表达的丰富性,可能加剧文化刻板印象。
    • 在生成质量上过半文化对象被错误表达,尤其在特定文化对象上,如中国特色服饰“唐装”容易被误解为普通“西服”。
  • 局限性与未来方向:
    • 当前数据集无法覆盖全球所有文化对象,尤其某些文化群体仍可能被低估。
    • 未来计划扩展数据集,增加专家参与以提升数据的全面性。
    • 拓展对新兴T2I模型(如Imagen)的分析,使研究覆盖更多样化模型。

附加信息

这篇研究通过详尽评估揭示了文本生成图像模型在文化表达上的偏见问题,并为改进下一代模型提供了启发性的思路。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/148011/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642877
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
AI 伦理、公平与问责、算法公平与偏见
work
职业/产业
AI/ML 研究员与工程师、律师与法律研究员、社会学家与人类学家
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文