叙事智能展望:创意视觉叙事选集

生成式AI(文本、图像、音乐、视频)互动叙事与沉浸式故事音乐人、DJ 与声音设计师电影与动画制作人视觉艺术家与设计师

文献标题

Envisioning Narrative Intelligence: A Creative Visual Storytelling Anthology

(设想叙事智能:一种创意视觉叙事文集)

文献信息

  • 作者: Brett A. Halperin, Stephanie M. Lukin
  • 机构: University of Washington, DEVCOM Army Research Laboratory
  • 发表时间及会议: 2023年4月23-28日, CHI '23, Hamburg, Germany
  • DOI: 10.1145/3544548.3580744
  • 主题领域: 人机交互 (HCI)、视觉叙事生成、创造性人工智能
  • 关键词: 偏见, 创造力, 众包, 叙事智能, 叙事系统, 故事生成, 视觉叙事

研究背景与问题

背景与研究领域

作者将“叙事智能”定义为计算机系统模仿并生成人类叙事的能力。近年来,人工智能(AI)在视觉叙事(基于一组图像生成故事)方向取得了进展。然而现有的视觉故事生成系统主要聚焦于图像描述的客观性,缺少对人类创造性和多样化的叙事过程的关注。

核心问题与挑战

  1. 人类创作过程的复杂性: 不同于传统的“图像-语句对应”模式,人类在构建故事时会使用视觉之外的信息——例如情感、偏见和想象力。
  2. 偏见与伦理问题: 叙事过程受作者个人的文化背景、语言偏见及视角选择所影响,这在真实世界中可能存在伦理隐患。
  3. 缺乏系统性数据集分析: 虽已有数据集(如VIST),但在创作背后的人类认知动态及语义层面尚未展开足够深入的研究。

研究目标

  • 建立人类创作故事的范例文集(anthology),用以设计更“创造性”、泛化性更强的AI叙事生成系统。
  • 探讨数据收集、分析与生成模型之间的伦理与偏见问题。

解决方案

方法与流程

  1. 数据收集:众包视觉叙事文集

    • 实验设计: 每个故事基于三个依序显示的图像生成,作者需完成四个结构化写作模块(实体识别、场景描述、跨图像叙事、标题创作)。
    • 图像来源:
      1. 高质量的Flickr图像。
      2. 低分辨率、模拟搜索救援(SAR)场景的机器人图像。
    • 创作工具: 在Amazon Mechanical Turk上设计HIT任务,要求参与者逐步完成故事,不可回溯修改。
  2. 定性分析手段

    • 人文学科的贴近阅读(close reading)与叙事知识工程(narrative knowledge engineering)。
    • 多轮迭代的主题分析,标注并提取跨故事的共性模式。

创新性

  • 分步创作过程: 通过实体、场景、叙事及标题划分,细化了图像到故事的映射路径,兼顾逻辑性与创造性。
  • 即兴叙事: 控制图像显示顺序,模拟创造性故事发展的实时动态过程。
  • 多样性与偏见解析: 通过探索不同偏见(语言文化、性别角色、社会阶层)对叙事实践的影响,提供了分析和改进叙事生成模型的基础。

研究成果

主要发现:五大主题

  1. 叙述视界内信息 vs. 想象

    • 人类创作中的三种叙事方式:结合图像的描述(caption)、推测(comment)、以及偏离原图内容的虚构(contrive)。
  2. 对象/实体的动态角色

    • 对象(如书或植物)从“静态道具”到“有情感的叙事角色”的构建。
  3. 情景的体验信息

    • 单感知(以视觉为主)和多感知(结合嗅觉、触觉和听觉)创作形式差异。
  4. 情绪调节与叙事弧线

    • 强化初始情绪(“从阴郁到厄运”)或反转情绪(“从阴郁到豁达”)。
  5. 叙事偏见

    • 表现在文化与语言(例如对非母语标识的解读偏差)、角色视角选择以及特定人物塑造上的偏向性。

实验分析结果

  • 文集包括100个多样化故事,共涉及73位独立作者。
  • 通过主题分析,提出了AI叙事生成中的“创造性、可靠性、表达力、充分性和责任感”五项评价标准。

与现有研究的对比优势

  • 与现有视觉叙事数据集(如VIST)相比,更强调叙事的生成路径而非单一文本描述。
  • 将场景理解带入深层次的语义领域,封闭了AI生成显性偏差(e.g. 性别刻板印象)的漏洞。

局限性与未来工作

  1. 数据多样性不足: 初期样本集中于高能语言使用者,需扩展创作群体以减少偏差。
  2. 自动化评估的潜力: 目前评估方法主要依赖人文定性分析,有待整合基于自动文本分析的工具。

总结与启发

该研究提出了一种开创性的、人-机关系居中的视角,注重叙事智能的伦理与多样性维度。未来发展包括开放故事文集供社区使用,并发展包含公共利益(如透明度与偏见控制)在内的叙事AI工具。这些成果不仅推动了HCI方法学的进步,也在跨学科领域(如教育、游戏设计和数字人文学)提供了更多可能性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/95915/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3580744
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、互动叙事与沉浸式故事
work
职业/产业
音乐人、DJ 与声音设计师、电影与动画制作人、视觉艺术家与设计师
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文