ELMI:歌曲演唱中歌词的手语交互式和智能化翻译

语音用户界面(VUI)设计对话式聊天机器人语音可访问性生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作语言治疗师与听觉学家音乐人、DJ 与声音设计师

研究背景与问题

  • 问题与挑战: 作者识别出歌曲手语翻译面临的四大挑战:

    1. 语义翻译 (Semantic Translation):理解歌词的含义,尤其是形式复杂、文化或语言特定的内容。
    2. 句法翻译 (Syntactic Translation):选择适合的手语符号,同时面临手语与英语语法差异。
    3. 表情与情感翻译 (Expressive Translation):将歌词的情绪通过表情和肢体语言传达给观众。
    4. 节奏翻译 (Rhythmic Translation):将手语翻译与歌曲的节奏进行同步,特别是在快速节奏的歌曲中,这是很多译者面临的挑战。
  • 研究重要性: 手语歌曲翻译是使音乐对d/Deaf(聋人/手语使用者)人群更加可访问的重要手段,涉及语言、文化和艺术元素的整合。现有研究更多关注音乐感知和沟通无障碍性,而鲜有从艺术和文化角度设计可访问的支持系统。

  • 相关背景: 以往关于手语翻译的研究,更多放在形式化手语的沟通场景中,如新闻播报或日常对话。对歌词翻译、特别是提供适合的创意支持工具的研究较少。

解决方案

  • 方法与工具: 作者提出并研发了一款交互式智能歌词翻译工具——ELMI (Explore Lyrics and Music Interactively)。该工具结合了实时歌词-视频同步、基于大语言模型(LLM)的对话功能,以及表演指导,帮助用户消解上述四类挑战。

  • 核心创新:

    1. 实时歌词和视频同步: 歌词逐行高亮,结合视频播放,方便用户匹配节奏和情感。
    2. 基于LLM的辅助讨论: 用户可以与ELMI讨论词义、翻译方法、情感表达与节奏同步问题,促进创意决策。
    3. 细粒度逐行翻译: 用户可逐行输入“gloss”(手语的文本表示),ELMI则实时给出改进建议。
  • 实施步骤与技术:

    1. 获取标准歌词和时间戳,通过自动语音识别 (ASR),对歌词和视频内容进行时间对齐以生成逐词标注。
    2. 用户可以逐行选择歌曲片段,通过丰富的视觉反馈(如动态高亮或表情建议)输入和编辑翻译版本。
    3. 用户与ELMI交流时,基于GPT-4的对话系统会生成与“语义、句法、情感、节奏翻译”相关的具体建议。

研究成果

  • 具体成果:

    1. ELMI被证明可以帮助用户更高效地捕捉歌词的深层含义与表演情感,明显改善了翻译的独立性与信心。
    2. 无论听力背景如何,参与者都能成功采用ELMI进行歌词翻译,同时结合个人风格生成多样化的翻译和表现。
  • 优势:

    1. 跨越多模态(视觉、听觉)协作,使音乐翻译对聋人用户更无障碍。
    2. AI驱动的反馈机制在交流中既能鼓励用户,也能提供建设性改进建议。
    3. 提供“多合一”的翻译工作空间,整合了歌词、视频及翻译操作。
  • 实验与评估:

    1. 针对《Butter》(BTS)等流行歌曲,研究表明ELMI的实时辅助系统显著减轻了翻译过程中的困难。
    2. 卡方测试和分析表明,d/Deaf用户更多关注节奏同步,而听力用户更关注情感传达。
  • 局限性与未来发展方向:

    1. 多参与者提出ELMI的输出有时过于依赖英语语法顺序或缺乏更深层的语义表达,需进一步提升模型对ASL语法及文化的理解。
    2. 缺乏多行视角支持(如对多行关联内容的广义翻译)。
    3. 应增加对手语词典的整合,用于提供更直观的符号展示(视频或示例)。

总结

通过开发ELMI,作者为手语歌词翻译带来了更高的文化敏感性与技术支持的可能性。未来工作可专注于增强跨文化情境的适配性与对ASL更深层次的理解,同时通过视频输入等多模态资讯扩展手语输入和表达能力。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/189454/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713973
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
语音用户界面(VUI)设计、对话式聊天机器人、语音可访问性、生成式AI(文本、图像、音乐、视频)
work
职业/产业
语言治疗师与听觉学家、音乐人、DJ 与声音设计师
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文