ExpressEdit:基于自然语言和草图的视频编辑

生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作AI 辅助创意写作视频制作与编辑电影与动画制作人UI/UX 设计师

信息视频是向新手和专家解释概念和程序知识的重要来源。在制作信息视频时,编辑者通过叠加文本/图像或剪辑 footage 来增强视频质量和吸引力。然而,视频编辑可能困难且耗时,尤其是对于常常难以表达和实现编辑想法的新手视频编辑者。为解决这一挑战,我们首先探索了多模态——自然语言(NL)和草图,这是人类用于表达的天然模态——如何支持视频编辑者表达视频编辑想法。我们从10位视频编辑者那里收集了176个多模态编辑表达,揭示了使用NL和草图描述编辑意图的模式。基于这些发现,我们提出了ExpressEdit——一个允许通过视频帧上的NL文本和草图进行视频编辑的系统。该系统由LLM和视觉模型驱动,解释(1)时间、(2)空间和(3)操作引用在NL命令中,以及草图中的空间引用。系统执行解释的编辑,然后用户可以迭代。观察研究(N=10)表明,ExpressEdit增强了新手视频编辑者表达和实现编辑想法的能力。系统允许参与者更高效地执行编辑,并通过基于用户多模态编辑命令生成编辑和支持迭代编辑命令来产生更多想法。这项工作为未来多模态界面和基于AI的视频编辑管道设计提供了见解。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/139195/2024

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、AI 辅助创意写作、视频制作与编辑
work
职业/产业
电影与动画制作人、UI/UX 设计师
article
内容状态
仅摘要
hub
相关论文
4 篇相关论文