ExpressEdit:基于自然语言和草图的视频编辑
作者
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作AI 辅助创意写作视频制作与编辑电影与动画制作人UI/UX 设计师
信息视频是向新手和专家解释概念和程序知识的重要来源。在制作信息视频时,编辑者通过叠加文本/图像或剪辑 footage 来增强视频质量和吸引力。然而,视频编辑可能困难且耗时,尤其是对于常常难以表达和实现编辑想法的新手视频编辑者。为解决这一挑战,我们首先探索了多模态——自然语言(NL)和草图,这是人类用于表达的天然模态——如何支持视频编辑者表达视频编辑想法。我们从10位视频编辑者那里收集了176个多模态编辑表达,揭示了使用NL和草图描述编辑意图的模式。基于这些发现,我们提出了ExpressEdit——一个允许通过视频帧上的NL文本和草图进行视频编辑的系统。该系统由LLM和视觉模型驱动,解释(1)时间、(2)空间和(3)操作引用在NL命令中,以及草图中的空间引用。系统执行解释的编辑,然后用户可以迭代。观察研究(N=10)表明,ExpressEdit增强了新手视频编辑者表达和实现编辑想法的能力。系统允许参与者更高效地执行编辑,并通过基于用户多模态编辑命令生成编辑和支持迭代编辑命令来产生更多想法。这项工作为未来多模态界面和基于AI的视频编辑管道设计提供了见解。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何利用自然语言与手绘草图组合的多模态交互方法,帮助用户更准确地表达视频编辑需求?分类: 多模态视频编辑表达与控制同类问题arrow_forward
- ExpressEdit系统能否在时间、空间及编辑参数的解析精度上达到用户预期?分类: 多模态视频编辑表达与控制同类问题arrow_forward
- 多模态交互技术在减少视频编辑复杂性和提高编辑效率方面有多大作用?分类: 多模态视频编辑表达与控制同类问题arrow_forward
lightbulb
现实痛点
1- 初学者进行信息性视频编辑时常面对操作复杂、表达意图困难的问题。分类: 多模态视频编辑表达与控制同类问题arrow_forward
快捷操作
一眼看懂
fact_check论文快照
dataset
来源
IUI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、AI 辅助创意写作、视频制作与编辑
work
职业/产业
电影与动画制作人、UI/UX 设计师
article
内容状态
仅摘要
hub
相关论文
4 篇相关论文