SynthScribe:用于合成器声音检索与探索的深度多模态工具
作者
生成式AI(文本、图像、音乐、视频)音乐创作与声音设计工具创意协作与反馈系统音乐人、DJ 与声音设计师
合成器是音乐家创造动态和原始声音的强大工具。现有商业合成器界面通常要求音乐家与复杂的底层参数交互或管理大量预制声音库。为解决这些挑战,我们实现了SynthScribe——一个使用多模态深度学习让用户能够在更高层次表达意图的完整系统。我们实现的功能解决了多个困难:1)搜索现有声音;2)创建全新声音;3)对给定声音进行有意义的小幅修改。这通过三个主要功能实现:用于大型合成器声音库的多模态搜索引擎;用户中心的遗传算法可根据用户偏好创建和选择全新声音;声音编辑支持功能可根据文本或音频查询突出显示关键控制参数并提供示例。我们的用户研究表明,SynthScribe能够可靠地检索和修改声音,同时还能创造全新声音,扩展音乐家的创作视野。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何使用多模态深度学习模型实现自然的合成器声音搜索和编辑?分类: 音乐创作、合成与AI生成工具同类问题arrow_forward
- 遗传算法如何帮助用户生成未预设的全新声音?分类: 音乐创作、合成与AI生成工具同类问题arrow_forward
- 哪些参数组对于用户期望的声音效果最为关键?分类: 音乐创作、合成与AI生成工具同类问题arrow_forward
lightbulb
现实痛点
1- 初学者难以直观操作复杂的合成器参数或筛选预设声音。分类: 音乐创作、合成与AI生成工具同类问题arrow_forward
- 80%
声音设计师-生成式AI互动:为专业声音设计师设计创意支持工具
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 80%
协同中的智能体:关于将 AI 带上舞台的实践案例研究
IUI '26· 音乐创作与声音设计工具 +2
- 75%
以沉默的方式:超越声音的AI与即兴音乐家之间的交流
CHI '19· 生成式AI(文本、图像、音乐、视频) +1
- 75%
音乐记谱的挑战及互动界面的潜力
CHI '24· 音乐创作与声音设计工具 +1
- 75%
理解基于提示的音乐生成人工智能的潜力和局限性
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 75%
expressive Communication:评估音乐创作中生成模型和引导界面的发展
IUI '22· 生成式AI(文本、图像、音乐、视频) +1
- 67%
SoundStager:视频故事驱动GenAI声音场景的交互式设计
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 67%
现场音乐智能体的设计空间
CHI '26· 音乐创作与声音设计工具 +2
- 67%
MIMOSA:视频计算空间音频效果的人机协作创作
C&C '24· 生成式AI(文本、图像、音乐、视频) +2
- 67%
人工智能音乐创作中的反思
C&C '24· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
一眼看懂
fact_check论文快照
dataset
来源
IUI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、音乐创作与声音设计工具、创意协作与反馈系统
work
职业/产业
音乐人、DJ 与声音设计师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文