探索音乐生成人工智能在聋人和听力障碍人士音乐创作中的潜力

生成式AI(文本、图像、音乐、视频)听觉障碍者支持(字幕、手语、振动)音乐创作与声音设计工具音乐人、DJ 与声音设计师辅助技术专家

研究背景与问题

  • 发现的问题或挑战
    作者发现尽管文本到音乐生成AI技术在音乐教育和治疗中展现了显著潜力,但这些技术仍在很大程度上将聋人和听力障碍(DHH)人群排除在外。当前的方法通常只针对基础音乐元素(如节奏),涉及复杂音乐创作时需要听人的帮助,从而限制了DHH用户的独立性。此外,许多DHH人群对音乐的态度存在负面影响,并缺乏在音乐创作中主动表达的自信。

  • 重要性
    音乐创作是一种重要的艺术形式,能促进多感官互动、学习和自我表达。为DHH人群提供平等的音乐创作机会是推进文化无障碍的一部分。从包容性艺术的角度来看,让DHH人群通过技术实现独立创作具有深远的社会和情感意义。

  • 研究动机与相关工作
    尽管已有一些研究通过视觉和触觉反馈增强了DHH人群的音乐理解能力,但这些研究大多专注于音乐欣赏或基础节奏创作,鲜少探索独立、多维度音乐创作的可能性。与此同时,生成型音乐AI技术的发展提供了一个新的可能性:通过自然语言交互增强音乐生成的便利性和复杂性。


解决方案

  • 提出的方法或解决方案
    作者设计并开发了一种融合自然语言输入、视觉和触觉反馈的多模态音乐创作辅助工具。这一系统能帮助DHH用户通过音乐生成AI (GenAI) 独立地创作和编辑音乐,并提供直观的替代感官反馈来理解音乐内容。

  • 创新之处

    • 工具采用生成式音乐AI,通过文本输入生成音乐,并转译为DHH人群可感知的视觉和触觉信息。
    • 系统支持基于个人意图的音乐编辑功能,结合歌词生成和音乐序列可视化,允许用户调整音乐直接输出。
    • 提出了针对DHH用户的设计要求,例如通过视觉元素(颜色、字体、动画)传递情感和音乐氛围。
  • 实施步骤与关键技术

    1. 音乐生成模块:提供基于自然语言的AI生成音乐功能;同时支持使用歌词或纯音乐的创作需求。
    2. 多模态感官替代模块:将生成的音乐通过视觉(如颜色、动画和歌词关联)和触觉反馈(如震动强度和节奏)进行转译以增强感知。
    3. 音乐编辑功能:允许基于视觉提示修改旋律、情感、节奏等音乐要素,结合自然语言提示优化输出。
      主要技术包括音乐生成AI框架 (如Suno),AI支持的音乐分析API,以及触觉反馈设备的集成设计。

研究成果

  • 具体成果

    • 开发了一个能够帮助DHH用户实现独立音乐创作的多模态音乐辅助工具。
    • 工具通过视觉和触觉反馈有效改善了DHH用户对音乐的理解力,并增强了其主动修改音乐的能力。
    • 参与实验的DHH用户表达了对音乐创作过程和成果的高度满意,大多数用户首次感受到音乐创作的自信和兴趣。
  • 与现有解决方案相比的优势

    • 支持从歌词生成到多维音乐创作的完整体验,而不依赖听觉群体。
    • 独特的感官反馈设计(视觉+触觉)使得DHH用户能够主动评估和修改音乐。
    • 在创作过程中同时促进用户的音乐知识增长和对音乐的兴趣。
  • 实验或评价结果

    • 在9名DHH参与者的测试中,该工具显著提高了用户的音乐创作独立性和自信心(满意度评分平均为6.5/7)。
    • 参与者展现出通过音乐表达情感和社交连接的强烈兴趣,部分用户表示工具帮助重新定义了对听力障碍的看法。
  • 局限性与未来方向

    • 局限性:当前实验样本量小,且音乐生成AI的时间延迟(1-3分钟)可能削弱了用户创作的连贯性。
    • 未来方向:
      • 提升AI模型的实时响应性与生成准确性以强化交互体验。
      • 增强用户输入的多模态支持(如手势输入、绘图界面)以更好适应DHH用户多样化的表达方式。
      • 增加反馈的个性化设置功能,允许根据个人感官偏好调整反馈模式(例如可选择仅使用视觉反馈或更强的触觉提示)。

通过提出并验证这种音乐生成AI与多模态感官替代系统的结合,该研究为提升DHH人群的音乐创作参与与艺术包容性提供了新的途径。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188616/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714298
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、听觉障碍者支持(字幕、手语、振动)、音乐创作与声音设计工具
work
职业/产业
音乐人、DJ 与声音设计师、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文