MIMOSA:视频计算空间音频效果的人机协作创作
作者
生成式AI(文本、图像、音乐、视频)音乐创作与声音设计工具创意协作与反馈系统内容创作者(YouTuber、Podcaster)音乐人、DJ 与声音设计师电影与动画制作人
空间音频为观众提供更沉浸式的视频消费体验;然而,创建和编辑空间音频通常成本高昂,需要专业设备和技能,这对业余视频创作者造成了很高的门槛。我们呈现了MIMOSA,一种人机协作工具,使业余用户能够计算生成和操作空间音频效果。对于仅有单声道或立体声音频的视频,MIMOSA 自动将每个声源接地到视觉场景中相应的发声物体,并使用户能够进一步验证和修复发声物体位置的错误。用户还可以通过灵活操作声源位置和创意定制音频效果来增强空间音频效果。MIMOSA 的设计体现了一种人机协作方法,它不使用最先进的端到端“黑盒”机器学习模型,而是使用多步管道,将其可解释的中间结果与用户的工作流程对齐。对15名参与者进行的实验室用户研究证明了 MIMOSA 在与用户协作创建沉浸式空间音频效果方面的可用性、有用性、表现力和能力。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 86%
VidTune:利用生成式音乐和视频缩略图创作视频配乐
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 86%
"我想要的是更多是一种氛围":为视频创作者设计文生音乐生成界面
DIS '25· 生成式AI(文本、图像、音乐、视频) +3
- 83%
声音设计师-生成式AI互动:为专业声音设计师设计创意支持工具
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 71%
SoundStager:视频故事驱动GenAI声音场景的交互式设计
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
人工智能音乐创作中的反思
C&C '24· 生成式AI(文本、图像、音乐、视频) +2
- 67%
将缓慢性作为设计个人数据长期体验框架的调查:对Olly的现场研究
CHI '19· 生成式AI(文本、图像、音乐、视频) +1
- 67%
通过示例创作音乐
CHI '20· 生成式AI(文本、图像、音乐、视频) +1
- 67%
Sound Sketchpad:一种表达性地组合大型多样化音频资源的技术系统
IUI '21· 音乐创作与声音设计工具 +1
- 67%
SynthScribe:用于合成器声音检索与探索的深度多模态工具
IUI '24· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
一眼看懂
fact_check论文快照
dataset
来源
C&C
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、音乐创作与声音设计工具、创意协作与反馈系统
work
职业/产业
内容创作者(YouTuber、Podcaster)、音乐人、DJ 与声音设计师、电影与动画制作人
article
内容状态
仅摘要
hub
相关论文
9 篇相关论文