未言之声:识别YouTube上非语音音频字幕的趋势

多语言与跨文化语音交互语音可访问性听觉障碍者支持(字幕、手语、振动)语言治疗师与听觉学家内容创作者(YouTuber、Podcaster)

文献标题

Unspoken Sound: Identifying Trends in Non-Speech Audio Captioning on YouTube

文献信息

  • 主题领域: 视频内容闭合字幕的非语言声音信息 (NSI) 研究
  • 关键词: 数据集, 闭合字幕, 非语言信息 (NSI), 额外语言信息 (ESI), 字幕质量, 音频描述, 视频可访问性

研究背景与问题

  • 作者发现的问题或挑战:

    • 在线视频的非语言声音信息 (NSI) 字幕覆盖不足,特别是在 YouTube 上。
    • 自动语音识别 (ASR) 技术只能处理有限类别的 NSI(如 "[Laughter]"、"[Music]"、"[Applause]"),对其他类型的 NSI支持不足。
    • 手动生成字幕的比例较低,大量视频未提供任何形式的字幕,特别是在大工作室制作的内容中。
    • 数据和分析工具的缺乏使研究在线 NSI 字幕质量变得困难。
  • 为什么这个问题很重要:

    • 视频内容的可访问性对于d/Deaf和重听(DHH)人群至关重要,但目前的字幕系统在 NSI 信息的质量和实施方面仍存在严重不足。
    • NSI 对于理解视频内容的叙述性和情感层面至关重要。如果缺乏字幕,这些观众可能会错过重要信息。
    • YouTube等平台上的视频上传量巨大,覆盖这些内容中的 NSI 有助于提高全球视频内容的可访问性。
  • 研究动机与相关工作:

    • NSI 的现状分析有限,多数研究集中在语言信息或视频用户体验上。
    • 相关工作已探讨了 NSI 分类、自动音频描述(AAC)模型和视频字幕用户偏好,但缺乏对 NSI在流行视频平台上的实际实施情况的深入研究。

解决方案

  • 研究方法:

    • 创建涵盖700,000+个 YouTube 视频的数据集,分析其字幕内容和元数据(覆盖2013至2022年的流行样本和大工作室样本)。
    • 手动注释3个目标年份中的1799个视频(2013、2018、2022),标记各种类型的 NSI。
    • 提出一种“NSI 估算器”(NSI Estimator)以自动检测字幕中的 NSI 信息,该估算方法基于常见 NSI 符号和格式(如 "["、"]"、":")。
    • 定义评价 NSI 字幕质量的指标(如 NSI 密度 CPMIP 和 NSI 存在比例)。
  • 创新点:

    • 结合手动注释和自动估算,全面评估 YouTube 字幕中 NSI 的现状,通过创建数据集揭示平台字幕实践的长期趋势。
    • 新提出了 NSI 的质量评估指标,并验证了机器辅助的 NSI 估算方法。

研究成果

  • 关键发现:

    • 自动字幕已占主导地位,但仍存在显著的 NSI 描述不足问题。手动字幕比例仅为6-8%。
    • 视频越短,其 NSI 字幕的密度越高;而长视频中的 NSI字幕显著减少。
    • NSI 的类别实现存在显著差异:大工作室样本主要集中于额外语言信息(如说话人标识),而流行样本则显示出更多种类的NSI覆盖。
    • 视频的主题和时长显著影响 NSI 的出现频率和质量,某些类别(如音乐、宗教主题)具有更丰富的 NSI 字幕。
  • 与现有解决方案的对比:

    • 提供了比现有的音频描述系统更全面的数据分析框架,揭示了字幕生成技术未能满足 DHH 观众需求的具体领域。
    • 与现有研究相比,更详细地展示了不同主题和视频制作流程对 NSI 字幕的影响。
  • 实验或评估结果:

    • 数据集中的 NSI 存在比例为 88-92%,但密度显著降低,远低于 Zdenek 等高质量字幕参考文献建议的3 CPMIP。
    • 基于大工作室样本的多样性熵分析表明,其 NSI 信息的覆盖率和类别多样性较流行样本低。
  • 局限性与未来方向:

    • 仅分析了基于英语的字幕和主要美国地区的内容,可能无法反映全球 YouTube 视频的情况。
    • 缺乏对字幕生成和媒体处理流程的进一步详细探讨,导致一些趋势的具体机制尚未完全揭示。
    • 未来应开发针对 NSI 的质量评价标准,进一步提高自动化模型的描述能力,同时探索社区驱动的字幕编辑工具对 NSI改进的潜力。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/146864/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642162
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
多语言与跨文化语音交互、语音可访问性、听觉障碍者支持(字幕、手语、振动)
work
职业/产业
语言治疗师与听觉学家、内容创作者(YouTuber、Podcaster)
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文