expressive Communication:评估音乐创作中生成模型和引导界面的发展

生成式AI(文本、图像、音乐、视频)音乐创作与声音设计工具音乐人、DJ 与声音设计师

文献标题

Expressive Communication: Evaluating Developments in Generative Models and Steering Interfaces for Music Creation

文献信息

  • 主题领域: 音乐生成与人机交互
  • 关键词: 量化方法、生成模型、引导界面、人机协同创作、音乐表达

研究背景与问题

  • 发现的问题或挑战:

    1. 机器学习 (ML) 社区主要关注创建能够生成音乐结构和连续性的生成模型,但这些模型通常不直接评估其对创作者的实际影响。
    2. 人机交互 (HCI) 社区关注设计更容易引导的界面,但其研究通常限制在创作者的自我报告,而很少关注生成音乐对听众的影响。
    3. 在音乐创作场景中,生成工具是否能够更好地表达创作者希望传达的图像或情感尚未被广泛研究。
    4. 不同社区的交叉领域合作有限,导致评估和目标方法之间不匹配。
  • 问题重要性: 探索生成模型和交互界面的发展如何影响创作者的表达和听众的感知,对于推动音乐创作领域的创新至关重要。这将提高创作者的创作自主权,并增强音乐生成工具的用户体验。

  • 研究动机与相关工作:

    • ML 社区倾向于使用代理指标(如生成样本质量)来评估模型,而非直接分析模型对音乐创作的实际促进作用。
    • HCI 社区通过用户研究评估生成工具的控制性和合作感,但忽略了对创作成果的听众评价。
    • 本研究旨在统一上述两个社区的方法,通过综合创作者自我反馈和听众评价,量化生成工具对音乐表达任务的支持。

解决方案

  • 提出的方法或解决方案: 作者设计了一项名为“表达式沟通”的研究框架,用于评估两种生成模型(Performance RNN 和 Music Transformer)及两种用户界面(Radio Interface 和 Steering Interface)的表现。其目标是观察这些生成工具对创作过程和生成结果的影响。

  • 创新点:

    1. 结合创作者的自我报告与听众的评价,提供对生成工具多维度评估的新方法。
    2. 在音乐生成工具的框架下,首次对模型功能与交互方式进行系统比较。
    3. 探讨如何解决生成模型在情感表达上的固有偏差,并分析引导界面能否弥补这一偏差。
  • 实施步骤与关键技术:

    1. 实验使用两种生成模型:
      • Performance RNN:较低表达性,模型复杂度较低。
      • Music Transformer:高表达性,能够更好处理长范围结构与音乐一致性。
    2. 实验采用两种用户界面:
      • Radio Interface:通过随机生成的完整音乐样本,进行选择和筛选。
      • Steering Interface:分段生成音乐,并允许用户基于语义参数进行控制(如速度、音调等)。
    3. 收集26名创作者的参与数据和20名听众的评价数据,展开定量分析和定性访谈。

研究成果

  • 具体成果:

    1. Model Comparison:
      • 与 Performance RNN 相比,Music Transformer 能更好地维持音乐一致性,同时提升创作者的效率和拥有感。
      • 听众更倾向评价 Music Transformer 生成的音乐符合目标情感。
    2. Interface Comparison:
      • Steering Interface 增强了创作者对音乐创作的控制感、拥有感和多种解决方案的能力。
      • 听众认为使用 Steering Interface 创建的音乐更符合目标情感,且音乐性更高。
  • 与现有解决方案的相比优势: 本研究不仅观察创作者对音乐生成工具的感知,还结合听众对生成音乐表达性的客观评价,从而提供更全面的评估视角。

  • 实验或评估结果:

    1. 提供更好的生成模型(Music Transformer)或更好的界面(Steering Interface)均能提升音乐表达目标的效果。
    2. Steering Interface 在表达一些情感(如恐惧和冲突)时更为有效,能够克服模型固有偏差。
  • 局限性与未来方向:

    • 局限性:
      1. 本研究对显性实验变量进行了严格的控制,但只涉及两种生成模型和两种界面类型,未能全面覆盖所有的音乐生成方法。
      2. 选择的情感卡片和语义控制参数可能对结果产生了限制性影响,无法全面展现音乐生成工具的通用性。
    • 未来方向:
      1. 增加多样化的生成模型和交互界面选项,探讨其对不同类型用户和创作任务的适应性。
      2. 进一步分析生成工具对特定情感或音乐风格表达的性能,以设计更适应创作者需求的生成技术。
      3. 建立标准化的跨研究比较基准,推动 ML 和 HCI 社区的协同发展,优化音乐生成领域的人机协作系统。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/79971/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3490099.3511159
一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、音乐创作与声音设计工具
work
职业/产业
音乐人、DJ 与声音设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文