Vistoria:一个通过工具化图像-文本协同编辑支持虚构故事写作的多模态系统

AI 辅助创意写作创意协作与反馈系统内容创作者(YouTuber、Podcaster)HCI 研究员

文献标题

Vistoria: A Multimodal System to Support Fictional Story Writing through Instrumental Image-Text Co-Editing

出版信息

  • 主题领域: 创意写作的多模态系统,重点在图像-文本协同编辑。
  • 关键词: 多模态交互,虚构故事写作,图像-文本对齐,创意支持,工具交互,协同编辑,叙事发展,大型语言模型(LLMs),认知过程,用户研究。

背景与问题

  • 问题/挑战: 现有的写作工具主要以文本为中心,将视觉元素视为辅助而非创作过程的核心部分。这种分离增加了认知负担,并限制了视觉与文本元素在叙事发展中的整合。
  • 重要性: 虚构故事写作本质上是多模态的,需要依赖视觉和文本渠道进行构思和表达。一个能够整合这些模态的系统可以增强创意,减少认知负担,并改善叙事连贯性。
  • 动机与相关工作: 以往的创意写作工具利用视觉元素进行灵感激发或结构组织,但缺乏同步、可操作的图像-文本编辑机制。近期的多模态系统和基于LLM的工具虽有所进展,但仍将图像和文本视为独立实体。本文通过设计一个紧密整合这些模态的系统来填补这一空白。

解决方案

  • 提出的方法: Vistoria,一个通过工具操作实现同步图像-文本协同编辑的多模态系统,支持叙事探索与发展。
  • 创新点:
    1. 引入工具操作(套索、拼贴、透视转换、滤镜)以实现同步图像-文本编辑。
    2. 提出一个对齐视觉与文本元素的循环工作流,支持迭代的叙事发展。
    3. 提供一个聚类面板,用于组织和重用叙事片段以形成连贯的故事线。
  • 流程与关键技术:
    • 多模态输入(文本、草图、图像)被转换为图像-文本卡片。
    • 工具操作允许用户同时操作和对齐文本与图像。
    • 聚类面板聚合叙事元素以实现结构化组织。
    • 系统采用多代理后端进行叙事构建、视觉合成和记忆管理。

结果

  • 具体发现:
    • Vistoria提升了表达力(平均得分:6.08 对比基线的 4.33,p=0.023)和沉浸感(平均得分:4.92 对比基线的 2.75,p=0.0006)。
    • 参与者探索了更多方向(平均:6.92 对比基线的 1.42)和分支(平均:3.00 对比基线的 1.92)。
    • 观察到更高的心理(平均:5.16 对比基线的 3.17,p=0.0000)和身体负荷(平均:4.67 对比基线的 2.08,p=0.0002)。
  • 相较基线的优势:
    • 支持发散性探索和更丰富的叙事发展。
    • 保持了参与者对创作过程的自主性和所有权。
    • 实现了同步的图像-文本编辑,而非仅限于文本的GPT工作流。
  • 实验/评估:
    • 进行了一项包含12名参与者(年龄21–32岁,均有创意写作经验)的对照用户研究。
    • 使用NASA-TLX和创意支持指数(CSI)调查表,以及定性访谈和系统日志,将Vistoria与仅文本的GPT基线进行比较。
  • 局限性与未来工作:
    • 短期任务(300–500字)可能无法反映长篇写作需求。
    • 小规模、文化同质的参与者样本限制了普适性。
    • 初次使用者的认知负荷较高;未来设计可包括自适应功能,并支持其他模态如音频。

总结

Vistoria是一个通过整合同步图像-文本协同编辑来支持虚构故事写作的多模态系统。它引入了工具操作(套索、拼贴、透视转换、滤镜),实现模态间的流畅转换,增强了表达力、沉浸感和探索性构思。尽管系统增加了认知需求,但它保留了用户的自主性和所有权,将用户视为主动创作者而非被动编辑者。未来工作将着眼于长篇写作的可扩展性、多样化参与者的纳入,以及减少工作负荷的自适应功能。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222530/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790400
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
AI 辅助创意写作、创意协作与反馈系统
work
职业/产业
内容创作者(YouTuber、Podcaster)、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文