理解基于提示的音乐生成人工智能的潜力和局限性
研究背景与问题
-
问题或挑战: 作者发现,目前基于提示的音乐生成人工智能(GenAI)具有通过自然语言与用户互动并高效生成音乐的优势,但面对传达复杂的艺术意图时仍存在局限性。语言与音乐的表达方式有所不同,这使得仅通过语言描述来生成音乐难以满足作曲者的精确需求。
-
问题的重要性: 随着生成式人工智能在视觉艺术、设计等领域的应用普及,音乐生成AI的潜力也在不断被探索。基于语言描述的音乐生成能够让用户更加轻松地参与音乐创作,这不仅对专业作曲家有意义,也为无经验的用户提供了参与创作的机会。然而,要实现真正的人机协作,这些系统需要更深刻地理解创作者的需求,并能根据不同的专业水平提供定制化支持。
-
研究动机与相关工作: 尽管基于提示的GenAI已被广泛应用于其他领域,但围绕用户如何使用音乐生成AI(尤其是基于提示的系统)的研究仍处于早期阶段。现有研究表明,用户的专业程度对AI生成音乐的使用方式有重要影响,如专家倾向于利用AI验证想法,而非专业用户则需要支持将抽象概念转化为具体的音乐。作者希望通过本研究,进一步探讨如何根据用户需求优化这些系统。
解决方案
-
方法与解决方案: 作者通过对三种不同类型的音乐生成AI互动形式进行研究(基于语言提示、预设选项、以及旋律输入的生成方式),以评估不同的交互类型如何满足用户的创作需求。实验中共包含17名具有不同音乐背景的参与者。
-
创新点:
- 提出了基于用户专业程度优化音乐生成系统的设计框架。
- 比较了三种主要交互模式,并揭示基于语言提示系统的潜力与不足。
- 通过语言提示系统分析了用户的独特应用策略,并提出具体设计指南以补足不足。
-
具体实施步骤:
- 实验设计: 对17名参与者进行远程实验,让其分别使用基于预设选项(Boomy)、旋律输入(DeepComposer)和语言提示(SUNO)的商业AI工具进行音乐创作。
- 数据收集: 使用逐步分析法,记录参与者的屏幕互动过程、问题日志和音乐作品,并对其进行后续问卷和半结构化访谈。
- 数据分析: 通过定量和定性分析提炼出参与者的使用模式、困难与偏好,从而形成完整的设计建议。
研究成果
-
具体成果:
- 用户偏好: 专业作曲家更倾向基于提示的系统用于快速验证概念;初学者偏好用其生成参考样本;非专业用户更看重系统转换抽象概念为实际音乐的能力。
- 优势与局限:
- 优势:基于提示的系统提高了创作效率,能够快速实现音乐概念,特别是在早期构思阶段对实验性作品和风格探索有帮助。
- 局限:系统在表达时间性和复杂音乐结构方面表现不足,语言提示存在难以准确传递艺术意图的问题。
- 实验及评价结果:
- 专家和普通听众的评估表明,基于提示生成的音乐在快速创作中质量较高,但在复杂修改部分专家组受到的限制较多。
- 非专业用户的音乐输出整体得到了更高的评分,反映了这些用户对"聆听友好型"音乐的偏好,而非技术复杂性。
-
局限性与未来方向:
- 样本量较小且特定类型AI工具间技术差异可能导致偏差。
- 不同工具功能的限制(如SUNO的语言描述可能无法捕捉复杂音乐特征),未来需开发整合三种交互类型的统一平台。
- 未来研究应进一步探索创作者的身份定位如何塑造其使用AI创作音乐的方式。
总结
该研究提供了关于基于提示的音乐生成AI潜力和局限的全面洞察。成果表明,用户的专业水平显著影响其与AI协作的方式。基于此,作者提出了多模式交互设计、会话式生成与精细时间控制界面的实现建议,旨在优化用户体验,支持多样化的创意需求。这些建议为未来AI在创作领域的发展奠定了坚实的基础,同时强调了用户中心设计的重要性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 不同音乐创作背景的用户如何与基于提示的音乐生成AI互动?分类: 音乐与音频生成创作同类问题arrow_forward
- 语言提示、预设选项和旋律输入哪种交互方式更能满足用户的创意需求?分类: 音乐与音频生成创作同类问题arrow_forward
- 基于提示的音乐生成AI在表达复杂艺术意图方面的局限性是什么?分类: 音乐与音频生成创作同类问题arrow_forward
现实痛点
1- 音乐生成AI难以通过语言提示满足创作者的复杂需求。分类: 音乐与音频生成创作同类问题arrow_forward
- 100%
以沉默的方式:超越声音的AI与即兴音乐家之间的交流
CHI '19· 生成式AI(文本、图像、音乐、视频) +1
- 100%
expressive Communication:评估音乐创作中生成模型和引导界面的发展
IUI '22· 生成式AI(文本、图像、音乐、视频) +1
- 75%
LoopMaker:从预录音乐中自动创建音乐循环
CHI '18· 生成式AI(文本、图像、音乐、视频) +1
- 75%
通过示例创作音乐
CHI '20· 生成式AI(文本、图像、音乐、视频) +1
- 75%
纠缠的纠缠:关于人机交互和音乐互动的衍射对话
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 75%
使用不协调风格探索人工智能生成内容的音乐创作
C&C '24· 生成式AI(文本、图像、音乐、视频) +2
- 75%
SynthScribe:用于合成器声音检索与探索的深度多模态工具
IUI '24· 生成式AI(文本、图像、音乐、视频) +2
- 60%
通过深度生成模型的AI引导工具进行新手AI音乐协同创作
CHI '20· 生成式AI(文本、图像、音乐、视频) +2
- 60%
声音设计师-生成式AI互动:为专业声音设计师设计创意支持工具
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 60%
AMUSE:多模态灵感驱动的人工智能与人类合作歌曲创作
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)