expressive Communication:评估音乐创作中生成模型和引导界面的发展
文献标题
Expressive Communication: Evaluating Developments in Generative Models and Steering Interfaces for Music Creation
文献信息
- 主题领域: 音乐生成与人机交互
- 关键词: 量化方法、生成模型、引导界面、人机协同创作、音乐表达
研究背景与问题
-
发现的问题或挑战:
- 机器学习 (ML) 社区主要关注创建能够生成音乐结构和连续性的生成模型,但这些模型通常不直接评估其对创作者的实际影响。
- 人机交互 (HCI) 社区关注设计更容易引导的界面,但其研究通常限制在创作者的自我报告,而很少关注生成音乐对听众的影响。
- 在音乐创作场景中,生成工具是否能够更好地表达创作者希望传达的图像或情感尚未被广泛研究。
- 不同社区的交叉领域合作有限,导致评估和目标方法之间不匹配。
-
问题重要性: 探索生成模型和交互界面的发展如何影响创作者的表达和听众的感知,对于推动音乐创作领域的创新至关重要。这将提高创作者的创作自主权,并增强音乐生成工具的用户体验。
-
研究动机与相关工作:
- ML 社区倾向于使用代理指标(如生成样本质量)来评估模型,而非直接分析模型对音乐创作的实际促进作用。
- HCI 社区通过用户研究评估生成工具的控制性和合作感,但忽略了对创作成果的听众评价。
- 本研究旨在统一上述两个社区的方法,通过综合创作者自我反馈和听众评价,量化生成工具对音乐表达任务的支持。
解决方案
-
提出的方法或解决方案: 作者设计了一项名为“表达式沟通”的研究框架,用于评估两种生成模型(Performance RNN 和 Music Transformer)及两种用户界面(Radio Interface 和 Steering Interface)的表现。其目标是观察这些生成工具对创作过程和生成结果的影响。
-
创新点:
- 结合创作者的自我报告与听众的评价,提供对生成工具多维度评估的新方法。
- 在音乐生成工具的框架下,首次对模型功能与交互方式进行系统比较。
- 探讨如何解决生成模型在情感表达上的固有偏差,并分析引导界面能否弥补这一偏差。
-
实施步骤与关键技术:
- 实验使用两种生成模型:
- Performance RNN:较低表达性,模型复杂度较低。
- Music Transformer:高表达性,能够更好处理长范围结构与音乐一致性。
- 实验采用两种用户界面:
- Radio Interface:通过随机生成的完整音乐样本,进行选择和筛选。
- Steering Interface:分段生成音乐,并允许用户基于语义参数进行控制(如速度、音调等)。
- 收集26名创作者的参与数据和20名听众的评价数据,展开定量分析和定性访谈。
- 实验使用两种生成模型:
研究成果
-
具体成果:
- Model Comparison:
- 与 Performance RNN 相比,Music Transformer 能更好地维持音乐一致性,同时提升创作者的效率和拥有感。
- 听众更倾向评价 Music Transformer 生成的音乐符合目标情感。
- Interface Comparison:
- Steering Interface 增强了创作者对音乐创作的控制感、拥有感和多种解决方案的能力。
- 听众认为使用 Steering Interface 创建的音乐更符合目标情感,且音乐性更高。
- Model Comparison:
-
与现有解决方案的相比优势: 本研究不仅观察创作者对音乐生成工具的感知,还结合听众对生成音乐表达性的客观评价,从而提供更全面的评估视角。
-
实验或评估结果:
- 提供更好的生成模型(Music Transformer)或更好的界面(Steering Interface)均能提升音乐表达目标的效果。
- Steering Interface 在表达一些情感(如恐惧和冲突)时更为有效,能够克服模型固有偏差。
-
局限性与未来方向:
- 局限性:
- 本研究对显性实验变量进行了严格的控制,但只涉及两种生成模型和两种界面类型,未能全面覆盖所有的音乐生成方法。
- 选择的情感卡片和语义控制参数可能对结果产生了限制性影响,无法全面展现音乐生成工具的通用性。
- 未来方向:
- 增加多样化的生成模型和交互界面选项,探讨其对不同类型用户和创作任务的适应性。
- 进一步分析生成工具对特定情感或音乐风格表达的性能,以设计更适应创作者需求的生成技术。
- 建立标准化的跨研究比较基准,推动 ML 和 HCI 社区的协同发展,优化音乐生成领域的人机协作系统。
- 局限性:
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 生成模型在音乐创作中的表达能力如何影响创作者的效率和感知?分类: 音乐创作、合成与AI生成工具同类问题arrow_forward
- 用户可以通过哪种交互界面更有效地控制音乐的情感表达和多样性?分类: 音乐创作、合成与AI生成工具同类问题arrow_forward
- 听众如何感知生成音乐与创作者意图的吻合度?分类: 音乐创作、合成与AI生成工具同类问题arrow_forward
现实痛点
1- 当前的生成音乐工具难以有效展现创作者的情感意图。分类: 音乐创作、合成与AI生成工具同类问题arrow_forward
- 100%
以沉默的方式:超越声音的AI与即兴音乐家之间的交流
CHI '19· 生成式AI(文本、图像、音乐、视频) +1
- 100%
理解基于提示的音乐生成人工智能的潜力和局限性
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 75%
LoopMaker:从预录音乐中自动创建音乐循环
CHI '18· 生成式AI(文本、图像、音乐、视频) +1
- 75%
通过示例创作音乐
CHI '20· 生成式AI(文本、图像、音乐、视频) +1
- 75%
纠缠的纠缠:关于人机交互和音乐互动的衍射对话
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 75%
使用不协调风格探索人工智能生成内容的音乐创作
C&C '24· 生成式AI(文本、图像、音乐、视频) +2
- 75%
SynthScribe:用于合成器声音检索与探索的深度多模态工具
IUI '24· 生成式AI(文本、图像、音乐、视频) +2
- 60%
通过深度生成模型的AI引导工具进行新手AI音乐协同创作
CHI '20· 生成式AI(文本、图像、音乐、视频) +2
- 60%
声音设计师-生成式AI互动:为专业声音设计师设计创意支持工具
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 60%
AMUSE:多模态灵感驱动的人工智能与人类合作歌曲创作
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)