Vidmento:基于生成式视频的脚手架式扩展视频故事创作工具
生成式AI(文本、图像、音乐、视频)视频制作与编辑创意协作与反馈系统内容创作者(YouTuber、Podcaster)电影与动画制作人UI/UX 设计师
文献标题
Vidmento: Creating Video Stories through Context-Aware Expansion with Generative Video
出版信息
- 主题领域: 使用生成媒体与捕获媒体的混合视频叙事
- 关键词: 生成视频、混合叙事、视频编辑、AI辅助创作、叙事扩展、电影原则、创意工具、视频创作、上下文感知生成、生成式人工智能
背景与问题
- 问题/挑战: 视频叙事受限于捕获素材的可用性,限制了创作者填补叙事空白或探索替代故事线的能力。现有的生成视频工具通常无法与捕获媒体无缝集成,缺乏上下文融合和叙事连贯性。
- 意义: 解决这些限制将使创作者能够通过结合捕获素材的真实性与生成媒体的灵活性,创作更丰富、更连贯的视频故事。
- 动机与相关工作: 现有工具主要关注完全捕获或完全生成的工作流程,通常将生成视频视为一个孤立的过程。本文识别了混合叙事方法的空白,并旨在通过在统一框架内融合捕获和生成媒体来弥补这一空白。
解决方案
- 提出的方法: Vidmento,一种视频创作工具,实施“生成扩展”框架,将捕获和生成媒体融合,用于混合视频叙事。
- 创新点:
- 引入“生成扩展”,一种用于上下文融合捕获和生成视频的设计框架。
- 开发Vidmento工具,结合叙事和电影原则支持混合视频创作。
- 基于形成性访谈和用户研究的实证发现,揭示混合叙事中的机会和挑战。
- 流程与关键技术:
- Vidmento提供一个半结构化画布,用于组织和排序媒体,并配备一个脚本编辑器用于叙述。
- 上下文感知AI生成新的视频片段和脚本建议,以填补叙事空白或扩展故事。
- 用户通过注释式优化、结构化提示和时间线对齐工具等功能保留创意控制。
- 系统采用两阶段流水线生成上下文关键帧并将其动画化为视频。
结果
- 具体发现:
- Vidmento使用户能够将原始媒体扩展平均96.4%,每次会话生成约31张图像和8段视频。
- 系统支持叙事探索,创作者平均点击3.7次故事建议,并生成2.0个优化脚本版本。
- 相较基线的优势:
- 与现有工具不同,Vidmento在统一工作空间内集成捕获和生成媒体,提供上下文感知融合和叙事框架。
- 用户认可其通过半结构化画布和同步脚本编辑器可视化和操作故事的能力。
- 实验/评估:
- 对12位创作者(从初学者到专业人士)进行用户研究,他们使用Vidmento制作了1–2分钟的叙述视频。
- 参与者强调了系统在创意构思、叙事扩展和媒体融合方面的实用性,但也提到优化生成输出的挑战。
- 局限性与未来工作:
- 挑战包括捕获与生成素材之间的风格不匹配、优化输出的困难,以及个人故事真实性的担忧。
- 未来方向包括改进模型适应性、探索空间和风格融合,以及设计完全统一的多模态画布。
总结
Vidmento引入了一种新颖框架“生成扩展”,通过融合捕获和生成媒体实现混合视频叙事。该系统通过上下文感知生成、叙事框架和创意控制支持创作者填补叙事空白并探索新的叙事可能性。在用户研究中,Vidmento扩展了创作者的工作流程,促进了创造力,同时保持了叙事连贯性。尽管在优化输出和风格融合方面存在挑战,该工具展示了AI辅助视频创作在扩展创意表达方面的潜力。未来工作将集中于增强适应性、探索新的融合维度以及优化混合叙事的用户界面设计。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 100%
重写视频:文本驱动的视频素材重创作
IUI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
VideoDiff:人类与AI的视频协同创作及其替代方案
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 71%
Protosampling:通过画布驱动的视觉AI生成实现采样与原型的自由形式融合
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
Videostrates:协作式、分布式和可编程视频处理
UIST '19· 视频制作与编辑 +1
- 67%
理解在广播系统中部署基于AI的内容创作支持工具的动态 - 优势、挑战和方向
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 67%
Videogenic:利用专业照片作为先验信息识别视频中的高光时刻
C&C '24· 生成式AI(文本、图像、音乐、视频) +1
- 67%
生成式转描:生成式视频到视频实践的自我回顾式探索
C&C '25· 生成式AI(文本、图像、音乐、视频) +1
- 63%
VidTune:利用生成式音乐和视频缩略图创作视频配乐
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 63%
"我想要的是更多是一种氛围":为视频创作者设计文生音乐生成界面
DIS '25· 生成式AI(文本、图像、音乐、视频) +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791337
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、视频制作与编辑、创意协作与反馈系统
work
职业/产业
内容创作者(YouTuber、Podcaster)、电影与动画制作人、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文