叙事智能展望:创意视觉叙事选集
生成式AI(文本、图像、音乐、视频)互动叙事与沉浸式故事音乐人、DJ 与声音设计师电影与动画制作人视觉艺术家与设计师
文献标题
Envisioning Narrative Intelligence: A Creative Visual Storytelling Anthology
(设想叙事智能:一种创意视觉叙事文集)
文献信息
- 作者: Brett A. Halperin, Stephanie M. Lukin
- 机构: University of Washington, DEVCOM Army Research Laboratory
- 发表时间及会议: 2023年4月23-28日, CHI '23, Hamburg, Germany
- DOI: 10.1145/3544548.3580744
- 主题领域: 人机交互 (HCI)、视觉叙事生成、创造性人工智能
- 关键词: 偏见, 创造力, 众包, 叙事智能, 叙事系统, 故事生成, 视觉叙事
研究背景与问题
背景与研究领域
作者将“叙事智能”定义为计算机系统模仿并生成人类叙事的能力。近年来,人工智能(AI)在视觉叙事(基于一组图像生成故事)方向取得了进展。然而现有的视觉故事生成系统主要聚焦于图像描述的客观性,缺少对人类创造性和多样化的叙事过程的关注。
核心问题与挑战
- 人类创作过程的复杂性: 不同于传统的“图像-语句对应”模式,人类在构建故事时会使用视觉之外的信息——例如情感、偏见和想象力。
- 偏见与伦理问题: 叙事过程受作者个人的文化背景、语言偏见及视角选择所影响,这在真实世界中可能存在伦理隐患。
- 缺乏系统性数据集分析: 虽已有数据集(如VIST),但在创作背后的人类认知动态及语义层面尚未展开足够深入的研究。
研究目标
- 建立人类创作故事的范例文集(anthology),用以设计更“创造性”、泛化性更强的AI叙事生成系统。
- 探讨数据收集、分析与生成模型之间的伦理与偏见问题。
解决方案
方法与流程
-
数据收集:众包视觉叙事文集
- 实验设计: 每个故事基于三个依序显示的图像生成,作者需完成四个结构化写作模块(实体识别、场景描述、跨图像叙事、标题创作)。
- 图像来源:
- 高质量的Flickr图像。
- 低分辨率、模拟搜索救援(SAR)场景的机器人图像。
- 创作工具: 在Amazon Mechanical Turk上设计HIT任务,要求参与者逐步完成故事,不可回溯修改。
-
定性分析手段
- 人文学科的贴近阅读(close reading)与叙事知识工程(narrative knowledge engineering)。
- 多轮迭代的主题分析,标注并提取跨故事的共性模式。
创新性
- 分步创作过程: 通过实体、场景、叙事及标题划分,细化了图像到故事的映射路径,兼顾逻辑性与创造性。
- 即兴叙事: 控制图像显示顺序,模拟创造性故事发展的实时动态过程。
- 多样性与偏见解析: 通过探索不同偏见(语言文化、性别角色、社会阶层)对叙事实践的影响,提供了分析和改进叙事生成模型的基础。
研究成果
主要发现:五大主题
-
叙述视界内信息 vs. 想象
- 人类创作中的三种叙事方式:结合图像的描述(caption)、推测(comment)、以及偏离原图内容的虚构(contrive)。
-
对象/实体的动态角色
- 对象(如书或植物)从“静态道具”到“有情感的叙事角色”的构建。
-
情景的体验信息
- 单感知(以视觉为主)和多感知(结合嗅觉、触觉和听觉)创作形式差异。
-
情绪调节与叙事弧线
- 强化初始情绪(“从阴郁到厄运”)或反转情绪(“从阴郁到豁达”)。
-
叙事偏见
- 表现在文化与语言(例如对非母语标识的解读偏差)、角色视角选择以及特定人物塑造上的偏向性。
实验分析结果
- 文集包括100个多样化故事,共涉及73位独立作者。
- 通过主题分析,提出了AI叙事生成中的“创造性、可靠性、表达力、充分性和责任感”五项评价标准。
与现有研究的对比优势
- 与现有视觉叙事数据集(如VIST)相比,更强调叙事的生成路径而非单一文本描述。
- 将场景理解带入深层次的语义领域,封闭了AI生成显性偏差(e.g. 性别刻板印象)的漏洞。
局限性与未来工作
- 数据多样性不足: 初期样本集中于高能语言使用者,需扩展创作群体以减少偏差。
- 自动化评估的潜力: 目前评估方法主要依赖人文定性分析,有待整合基于自动文本分析的工具。
总结与启发
该研究提出了一种开创性的、人-机关系居中的视角,注重叙事智能的伦理与多样性维度。未来发展包括开放故事文集供社区使用,并发展包含公共利益(如透明度与偏见控制)在内的叙事AI工具。这些成果不仅推动了HCI方法学的进步,也在跨学科领域(如教育、游戏设计和数字人文学)提供了更多可能性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何在视觉故事生成中平衡逻辑性和创造性以更符合人类的叙述模式?分类: 生成式创作中的控制与共创同类问题arrow_forward
- 偏见(如文化、语言、性别角色)如何影响视觉故事生成系统的叙述实践?分类: 生成式创作中的控制与共创同类问题arrow_forward
- 现有的数据集如何在支持认知动态和语义层次分析上有所不足?分类: 生成式创作中的控制与共创同类问题arrow_forward
lightbulb
现实痛点
1- 现有视觉故事生成系统缺乏创造性和对人类叙述复杂性的体现。分类: 生成式创作中的控制与共创同类问题arrow_forward
- 100%
人造梦境:超现实视觉叙事作为对AI「幻觉」的探究
DIS '24· 生成式AI(文本、图像、音乐、视频) +1
- 83%
通过共同设计探索实践中音乐家在共同创造人工智能中的需求
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3580744
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、互动叙事与沉浸式故事
work
职业/产业
音乐人、DJ 与声音设计师、电影与动画制作人、视觉艺术家与设计师
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文