EditIQ:通过对话理解和显著性线索实现静态广角视频的自动电影剪辑

生成式AI(文本、图像、音乐、视频)视频制作与编辑电影与动画制作人软件工程师与开发者AI/ML 研究员与工程师

我们提出了EditIQ,一个完全自动化的框架,用于对通过静止、大视场和高分辨率摄像机拍摄的场景进行电影剪辑。在静态摄像机馈送中,EditIQ首先生成多个虚拟馈送,模拟一组摄像师团队。这些被称为素材的虚拟摄像机镜头随后使用自动剪辑算法进行组装,其目标是向观众呈现最生动的场景内容。为了理解关键场景元素并指导剪辑过程,我们采用双管齐下的方法:(1)基于大语言模型的对话理解模块来分析对话流程,(2)视觉显著性预测以识别有意义的场景元素并从中选择摄像机镜头。然后,我们将电影视频剪辑表述为一个能量最小化问题,其中电影约束决定了镜头选择、转换和连续性。EditIQ在保持电影连贯性和流畅观看体验的同时,合成出原始叙事的美学和视觉上引人注目的表示。我们通过在BBC Old School数据集和十一场戏剧表演视频上进行的二十名参与者的心理物理学研究,证明了EditIQ相对于竞争基线的有效性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/195844/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3708359.3712113
一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、视频制作与编辑
work
职业/产业
电影与动画制作人、软件工程师与开发者、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
1 篇相关论文