MIMOSA:视频计算空间音频效果的人机协作创作

生成式AI(文本、图像、音乐、视频)音乐创作与声音设计工具创意协作与反馈系统内容创作者(YouTuber、Podcaster)音乐人、DJ 与声音设计师电影与动画制作人

空间音频为观众提供更沉浸式的视频消费体验;然而,创建和编辑空间音频通常成本高昂,需要专业设备和技能,这对业余视频创作者造成了很高的门槛。我们呈现了MIMOSA,一种人机协作工具,使业余用户能够计算生成和操作空间音频效果。对于仅有单声道或立体声音频的视频,MIMOSA 自动将每个声源接地到视觉场景中相应的发声物体,并使用户能够进一步验证和修复发声物体位置的错误。用户还可以通过灵活操作声源位置和创意定制音频效果来增强空间音频效果。MIMOSA 的设计体现了一种人机协作方法,它不使用最先进的端到端“黑盒”机器学习模型,而是使用多步管道,将其可解释的中间结果与用户的工作流程对齐。对15名参与者进行的实验室用户研究证明了 MIMOSA 在与用户协作创建沉浸式空间音频效果方面的可用性、有用性、表现力和能力。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/cc/157782/2024

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
C&C
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、音乐创作与声音设计工具、创意协作与反馈系统
work
职业/产业
内容创作者(YouTuber、Podcaster)、音乐人、DJ 与声音设计师、电影与动画制作人
article
内容状态
仅摘要
hub
相关论文
9 篇相关论文