艺术还是人工制品?大型语言模型与创造力的虚假承诺
作者
大语言模型(LLM)的人机协作AI 辅助创意写作音乐人、DJ 与声音设计师软件工程师与开发者UI/UX 设计师
文献标题
Art or Artifice? Large Language Models and the False Promise of Creativity
文献信息
- 主题领域: 人工智能与创造性写作
- 关键词: 人类-人工智能协作, 大型语言模型, 设计方法, 叙事评估, 自然语言生成, 创造性评价, 创意写作方法
研究背景与问题
- 问题描述: 随着大型语言模型(LLMs)的发展,它们在输出“创造性写作”方面表现出色。然而,如何客观地评价这些文本的创造力依然是一个挑战。现有研究发现,LLMs生成的内容通常缺乏原创性或深度,有时甚至依赖于训练数据中的重复模式。
- 重要性: 创造性写作是人类表达思想和情感的重要手段。准确评估AI生成内容的创造力不仅推动技术进步,还可用于开发更好的人机交互工具。
- 研究动机: 该研究旨在通过评估LLMs生成文本的创造力,与专家写作进行比较,以揭示大型语言模型在创造力方面的缺陷,同时提供改进评估方法的新框架。
解决方案
- 提出方法: 作者基于Torrance Tests of Creative Thinking (TTCT) 测试框架开发了一种专门针对写作的创造力评估方法,称为Torrance Test for Creative Writing (TTCW)。该框架由4个维度(流畅性、灵活性、原创性、细化性)组成,并进一步细化为14个具体的二元测试。
- 创新性:
- TTCW框架是首次将TTCT适配为“以产品为导向”的评估标准,而非过程导向。
- 引入人类专家的评估,由多个专家对AI与人类创作的短篇小说进行比较。
- 开发可以被实际用于未来技术开发的详细评估基准。
- 实施步骤:
- 创建TTCW: 与8名创造性写作专家合作,从其反馈中提炼14个可操作测试。
- 数据收集: 使用12篇《纽约客》所选短篇故事作为人写上限,并生成基于这些故事情节的LLMs版本(包括ChatGPT、GPT4与Claude V1.3)。
- 专家评估协议: 招募10名专家,匿名评估48篇故事。每篇故事基于14个测试进行二元打分并附理由。
- 数据分析与验证: 分析2,000多条专家测试数据,评估一致性与得分分布对比。
研究成果
- 具体成果:
- 人类创作的故事通过测试的平均比例为84.7%,远高于LLMs生成的故事(约9%至30%)。
- Claude V1.3在流畅性、灵活性和细化性维度表现相对较好,而GPT4在原创性维度得分更高。
- 当前LLMs无法精准地执行TTCW测试,与专家评估结果的相关性接近零。
- 与现有解决方案相比的优势:
- TTCW结合专家意见严谨设计,提供多维度评价,实验验证性强。
- 系统性揭示了LLMs与人类创造性写作间巨大差距,明确改进方向。
- 实验或评估结果:
- 实验验证了TTCW框架的可靠性,单个测试中专家一致性为适度(Fleiss Kappa平均值为0.41),集合评价一致性显著增强(Pearson相关性0.69)。
- LLM生成文本较难通过与“原创性”与“修饰性”相关的测试,主要体现在对复杂情感的表达与避免陈词滥调方面。
- 专家对LLMs的“AI生成特征”有具体观察,如语法正确但内容浅薄、对比与修饰过度复杂或冗余等。
- 局限性与未来方向:
- 局限性:
- 当前框架基于北美文学写作惯例设计,可能无法涵盖不同文化背景下的创作习惯。
- 当前LLMs评估TTCW表现不佳,尚不足以用于自动化评估。
- 未包含其他创造性写作形式(如剧本、诗歌等)的测试。
- 未来方向:
- 开发更广泛适用的评估工具,包含不同内容类型(如营销文案、诗歌等)。
- 进一步优化LLMs算法与参数以提高生成文本的创造力。
- 扩充专家面试范围以及TTCT指标,减少文化与风格偏倚。
- 局限性:
通过该研究,作者提出了一个严谨的创造力评价框架,为未来研究和技术开发提供了有力支持,同时揭示了LLMs在创造性写作领域的局限性,有助于推动人机协作交互工具的发展。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何通过构建评估框架,准确评估大语言模型生成内容的创意性?分类: 生成式写作与故事创作控制同类问题arrow_forward
- 大语言模型生成的短篇故事在与人类创作的对比中,其创意性体现在哪些方面存在不足?分类: 生成式写作与故事创作控制同类问题arrow_forward
- 基于北美文学写作规范设计的创意评估方法是否适合用于评估大语言模型的生成内容?分类: 生成式写作与故事创作控制同类问题arrow_forward
lightbulb
现实痛点
1- 用户无法判断AI生成内容的创意性是否达到人类水平。分类: 生成式写作与故事创作控制同类问题arrow_forward
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642731
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助创意写作
work
职业/产业
音乐人、DJ 与声音设计师、软件工程师与开发者、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文