FAME:面向d/Deaf个体的抒情与非抒情音乐可视化表达性面部替身探索
作者
听觉障碍者支持(字幕、手语、振动)音频无障碍(字幕、手语、振动)无障碍游戏语言治疗师与听觉学家辅助技术专家
文献标题
FAME: Exploring Expressive Facial Avatars for Lyrical and Non-Lyrical Music Visualization for d/Deaf Individuals
出版信息
- 主题领域: 使用表情化虚拟头像提升聋人及听障(DHH)群体的音乐可访问性。
- 关键词: 可访问性, 聋人, 音乐可视化, 面部虚拟头像, 唇语同步, 字幕, 节奏, 情感, 非歌词音乐。
背景与问题
- 问题/挑战: 现有为DHH群体设计的音乐可视化工具(如字幕和抽象可视化器)未能充分传递音乐的情感深度、节奏和结构细微差异。唇语同步系统通常认知负担较重且缺乏表现力,而非歌词音乐的探索仍然不足。
- 重要性: 提升DHH群体的音乐可访问性对于包容性至关重要,有助于更丰富地体验音乐的情感、节奏和歌词元素。
- 动机与相关研究: 之前的研究探索了抽象可视化器、触觉系统以及基于虚拟头像的唇语同步工具,但这些方法缺乏与DHH用户的共同设计、情感表现力以及对非歌词音乐的支持。本论文旨在通过探索融合多模态线索的虚拟头像系统来弥补这些空白。
解决方案
- 提出的方法: FAME(Facial Avatar for Musical Expression),一个通过表情化面部动画、同步字幕和乐器高亮来可视化音乐的系统,同时为歌词提供唇语同步,为旋律提供拟声唱法。
- 创新点:
- 将字幕、乐器线索和虚拟头像表演结合起来传递音乐元素。
- 引入拟声唱法虚拟头像用于非歌词音乐,保持视觉吸引力。
- 强调风格化、情感表达丰富的虚拟头像,避免“恐怖谷”效应并提升清晰度。
- 探索虚拟头像作为表演者、解释者和音乐可访问性伴侣的角色。
- 流程与关键技术:
- 与9名DHH参与者进行形成性研究以确定设计需求。
- 开发FAME,整合字幕、乐器高亮和虚拟头像动画。
- 与12名DHH参与者进行两阶段探索性研究,评估FAME与基线可视化器(ViTune)的表现,并收集对其功能的反馈。
结果
- 具体发现:
- FAME在音乐与可视化匹配方面的准确率达95.8%,优于ViTune(66.7%准确率,p = 0.026)。
- 参与者高度评价FAME在传递歌词(中位数=4)、情感(中位数=4)和节奏(中位数=4)方面的表现,但在旋律传递方面效果较弱(中位数=2)。
- 字幕被认为是必不可少的,其实用性评分中位数为5。
- 相较基线的优势:
- 与抽象可视化器相比,提升了对歌词和情感元素的理解。
- 在歌词音乐中表现出更高的匹配准确率和情感参与度。
- 实验/评估:
- 比较阶段:参与者在四首歌曲中将FAME和ViTune的可视化与音频进行匹配。
- 应用阶段:参与者探索FAME的功能(虚拟头像、字幕、乐器高亮)在多种音乐类型中的表现。
- 评估指标:准确率、响应时间、Likert量表评分以及访谈的主题分析。
- 局限性与未来工作:
- 参与者多样性有限;大多数参与者已对音乐有一定兴趣。
- 研究集中于高唤醒度音乐类型,较少涉及氛围或低唤醒度音乐。
- 在线研究环境可能无法反映现实场景,如音乐会。
- 手动预处理限制了系统的可扩展性;未来工作应实现实时自动化。
总结
本文提出了FAME,一个基于面部虚拟头像的系统,旨在通过可视化歌词、节奏和情感提升DHH群体的音乐可访问性。通过迭代设计与评估,FAME在音乐理解和情感参与方面相较基线可视化器表现出显著提升。主要贡献包括整合字幕与乐器高亮、为非歌词音乐引入拟声唱法以及强调表现力清晰度而非照片真实感。未来工作应解决可扩展性问题,扩展至多样化音乐类型,并探索在音乐会和卡拉OK等社交场景中的实际应用。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790402
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
听觉障碍者支持(字幕、手语、振动)、音频无障碍(字幕、手语、振动)、无障碍游戏
work
职业/产业
语言治疗师与听觉学家、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文