艺术还是人工制品?大型语言模型与创造力的虚假承诺

大语言模型(LLM)的人机协作AI 辅助创意写作音乐人、DJ 与声音设计师软件工程师与开发者UI/UX 设计师

文献标题

Art or Artifice? Large Language Models and the False Promise of Creativity

文献信息

  • 主题领域: 人工智能与创造性写作
  • 关键词: 人类-人工智能协作, 大型语言模型, 设计方法, 叙事评估, 自然语言生成, 创造性评价, 创意写作方法

研究背景与问题

  • 问题描述: 随着大型语言模型(LLMs)的发展,它们在输出“创造性写作”方面表现出色。然而,如何客观地评价这些文本的创造力依然是一个挑战。现有研究发现,LLMs生成的内容通常缺乏原创性或深度,有时甚至依赖于训练数据中的重复模式。
  • 重要性: 创造性写作是人类表达思想和情感的重要手段。准确评估AI生成内容的创造力不仅推动技术进步,还可用于开发更好的人机交互工具。
  • 研究动机: 该研究旨在通过评估LLMs生成文本的创造力,与专家写作进行比较,以揭示大型语言模型在创造力方面的缺陷,同时提供改进评估方法的新框架。

解决方案

  • 提出方法: 作者基于Torrance Tests of Creative Thinking (TTCT) 测试框架开发了一种专门针对写作的创造力评估方法,称为Torrance Test for Creative Writing (TTCW)。该框架由4个维度(流畅性、灵活性、原创性、细化性)组成,并进一步细化为14个具体的二元测试。
  • 创新性:
    1. TTCW框架是首次将TTCT适配为“以产品为导向”的评估标准,而非过程导向。
    2. 引入人类专家的评估,由多个专家对AI与人类创作的短篇小说进行比较。
    3. 开发可以被实际用于未来技术开发的详细评估基准。
  • 实施步骤:
    1. 创建TTCW: 与8名创造性写作专家合作,从其反馈中提炼14个可操作测试。
    2. 数据收集: 使用12篇《纽约客》所选短篇故事作为人写上限,并生成基于这些故事情节的LLMs版本(包括ChatGPT、GPT4与Claude V1.3)。
    3. 专家评估协议: 招募10名专家,匿名评估48篇故事。每篇故事基于14个测试进行二元打分并附理由。
    4. 数据分析与验证: 分析2,000多条专家测试数据,评估一致性与得分分布对比。

研究成果

  • 具体成果:
    1. 人类创作的故事通过测试的平均比例为84.7%,远高于LLMs生成的故事(约9%至30%)。
    2. Claude V1.3在流畅性、灵活性和细化性维度表现相对较好,而GPT4在原创性维度得分更高。
    3. 当前LLMs无法精准地执行TTCW测试,与专家评估结果的相关性接近零。
  • 与现有解决方案相比的优势:
    • TTCW结合专家意见严谨设计,提供多维度评价,实验验证性强。
    • 系统性揭示了LLMs与人类创造性写作间巨大差距,明确改进方向。
  • 实验或评估结果:
    1. 实验验证了TTCW框架的可靠性,单个测试中专家一致性为适度(Fleiss Kappa平均值为0.41),集合评价一致性显著增强(Pearson相关性0.69)。
    2. LLM生成文本较难通过与“原创性”与“修饰性”相关的测试,主要体现在对复杂情感的表达与避免陈词滥调方面。
    3. 专家对LLMs的“AI生成特征”有具体观察,如语法正确但内容浅薄、对比与修饰过度复杂或冗余等。
  • 局限性与未来方向:
    1. 局限性:
      • 当前框架基于北美文学写作惯例设计,可能无法涵盖不同文化背景下的创作习惯。
      • 当前LLMs评估TTCW表现不佳,尚不足以用于自动化评估。
      • 未包含其他创造性写作形式(如剧本、诗歌等)的测试。
    2. 未来方向:
      • 开发更广泛适用的评估工具,包含不同内容类型(如营销文案、诗歌等)。
      • 进一步优化LLMs算法与参数以提高生成文本的创造力。
      • 扩充专家面试范围以及TTCT指标,减少文化与风格偏倚。

通过该研究,作者提出了一个严谨的创造力评价框架,为未来研究和技术开发提供了有力支持,同时揭示了LLMs在创造性写作领域的局限性,有助于推动人机协作交互工具的发展。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/147597/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642731
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助创意写作
work
职业/产业
音乐人、DJ 与声音设计师、软件工程师与开发者、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文