OnomaCap:通过拟声词声音表示使非语音字幕易于访问和享受

语音可访问性听觉障碍者支持(字幕、手语、振动)通用设计与包容性设计语言治疗师与听觉学家中小学教师(K-12)特殊教育教师儿童教育工作者

研究背景与问题

  • 作者发现了哪些问题或挑战? 当前的非语音声音字幕仅以简单类别描述为主(如"[爆炸声]"或"[大笑]"),忽略了声音表达的丰富细节,例如音量变化、时间变化或情感氛围。这种做法对于聋人和重听(DHH)观众来说无法提供完整的声音体验。此外,生成这些字幕的过程通常费时且质量参差不齐。

  • 为什么这个问题很重要? 非语音声音(如环境声音、音效、背景音乐)在视频的氛围营造和内容理解中起着关键作用。没有丰富的声音信息,DHH观众可能会错过重要情感或情节细节。

  • 研究动机与相关工作 作者受以声音模仿为基础的拟声词(onomatopoeia)的启发,认为其能够以简洁的文字捕捉声音表达的多样性。然而,现有的拟声词在非语音声音字幕中的使用较少,且其效果缺乏系统性研究。这种潜力促使作者提出一个研究框架,以改善非语音声音的可访问性。

解决方案

  • 作者提出了哪些方法或解决方案? 作者开发了一个名为“OnomaCap”的系统,该系统使用拟声词生成模型将非语音声音转录为拟声表达,并自动生成字幕。这种方法结合了声音分类模块和拟声词转录模块。

  • 该解决方案的创新之处是什么?

    • 提出了一个专门设计的声音转录模型,将声音直接转化为拟声词。
    • 构建了一个包含7,962个声音与拟声词对的数据集,用于模型训练。
    • 进行了详细的用户研究,评估拟声字幕对DHH观众视频体验的影响。
  • 实施步骤是什么?使用了哪些关键技术?

    1. 数据收集:从声音数据集中提取音频样本,由听力正常的标注者转录为拟声词。
    2. 模型开发:设计两种模型结构(基于编码器-解码器架构和前缀调整模型),分别用于拟声词生成。
    3. 系统构建:将声音类别分类模型和拟声词转录模型结合到一个字幕生成系统。
    4. 用户评估:通过实验和用户访谈研究不同字幕类型对DHH观众视频体验的影响。

研究成果

  • 取得了哪些具体成果?

    • 作者的声音转录模型生成的拟声词在主观评估中被认为与人类标注过的拟声词不可区分。
    • DHH参与者普遍认为拟声字幕增强了他们对视频内容和氛围的理解,提高了观看兴趣和沉浸感。
    • 基于拟声词与声音类别结合的字幕(category+onoma)被认为是最优的字幕类型。
  • 与现有解决方案相比,它有哪些优势?

    1. 较传统的类别描述字幕:拟声词字幕能够传达更多声音细节和情感信息。
    2. 与图形化声音设计相比:拟声词保持了较高的可读性,并适用于各种视频类型。
  • 实验或评估结果是什么?

    • 在用户实验中,参与者对拟声词生成模型的主观评分均超过3.8(满分为5),表明拟声词具有足够的自然性和表达力。
    • 实验中,DHH观众对字幕类型(category, onoma, category+onoma)的偏好明显变化,以category+onoma为最具表现力类型。
  • 局限性与未来方向

    • 模型生成的拟声词可能会因数据集限制而偏向某些语言。例如,此研究仅使用韩语数据,跨语言和文化通用性仍需验证。
    • 在某些情况下,仅使用拟声词可能造成误解,例如不熟悉的声音或缺乏上下文提示。
    • 未来可以探索结合视觉设计的拟声词字幕以增强效果,以及调节字幕个性化选项以满足多样用户需求。

此研究显著提高了我们对非语音声音字幕的理解,并为增强DHH观众音视频体验开辟了新方向。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/189250/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713911
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
语音可访问性、听觉障碍者支持(字幕、手语、振动)、通用设计与包容性设计
work
职业/产业
语言治疗师与听觉学家、中小学教师(K-12)、特殊教育教师、儿童教育工作者
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文