可见的细微差别:为聋人和重听人士可视化副语言语音线索的字幕系统

语音可访问性听觉障碍者支持(字幕、手语、振动)通用设计与包容性设计语言治疗师与听觉学家残障服务提供者

文献标题

Visible Nuances: A Caption System to Visualize Paralinguistic Speech Cues for Deaf and Hard-of-Hearing Individuals

文献信息

  • 主题领域: 可访问性技术,尤其是为听障人士设计的视频字幕系统
  • 关键词: 字幕设计, 语音无障碍, 副语言线索, 听障人士, 情绪可视化, 视觉化, 音频可视化

研究背景与问题

  • 当前字幕系统主要传递文字内容,忽略了语音的副语言线索(如语调、语气、强度),使得听障人士无法完全理解说话者的意图和情绪。
  • 现有系统的一些改进(如手工输入情绪信息或通过特定显示方式呈现基本的音频特征)存在局限性:手动输入费时费力,且显示方式不足以表达复杂的语音情绪。
  • 针对听障人士,通过字幕传递语音的副语言线索是一项重要但尚未完全解决的研究课题。

解决方案

  • 总体方法: 提出一种音频可视化字幕系统,将语音中的副语言线索(音量、音高和情绪等)转化为视觉元素(如字幕字体的粗细、文字高度、字体风格和运动)。
  • 创新之处:
    • 首次在字幕中应用动态字体、文字运动等高级视觉元素来传递复杂语音的情绪和语调。
    • 系统结合了音频分析算法和预定义的视觉映射规则。
  • 实施步骤:
    1. 音频分离: 使用音源分离模型(Spleeter)提取视频中的人声。
    2. 特征提取与情绪分类: 将音频样本细分为音节单元,提取音量和音高特征,使用情绪分类器识别情绪。
    3. 字幕生成: 根据音频特征和情绪结果,映射字幕的字体风格、运动、厚度和高度,生成实时动态字幕。
  • 关键技术:
    • 音频分离技术
    • 音量、音高特征标准化算法
    • 复杂情绪的分类与映射设计

研究成果

  • 具体成果:
    1. 实现了针对听障人士的动态字幕原型系统,能够在视频中用视觉化方式呈现语音副语言细节。
    2. 在20位听障参与者中验证该系统的实用性和用户体验。
  • 与现有解决方案相比的优势:
    • 能够更直观地传递情绪和语气,提高视频内容的语音可访问性。
    • 在正式演讲视频中,能效地帮助听障者识别讲话者的语气和意图。
  • 实验或评估结果:
    • 在正式演讲视频中,使用高级字幕系统的参与者在识别讲话者意图上的准确性从22.5%提升到45%。
    • 在情绪识别任务中,高级字幕系统使得听障者对细致的情绪子类(如讽刺、孤独等)的识别准确率提高了20%。
    • 高级字幕系统在内容表达力和用户满意度上表现出显著优势,特别是对于不易通过面部表情解读语气的演讲视频。
  • 局限性与未来方向:
    • 局限性:
      • 部分参与者对动态字幕系统的视觉干扰感到不适应,如字体运动带来的阅读疲劳。
      • 当前情绪分类系统覆盖范围有限,仅包括6个情绪类别。
      • 系统依赖人工情绪标注,未完全实现自动化。
    • 未来方向:
      • 优化字幕的设计,减少视觉负担(如优化字体风格和运动频率)。
      • 扩展字幕系统的情绪分类能力,支持更细腻的情绪变化表达。
      • 提高系统的自动化水平,开发实时情绪分类和音频分析模块。
      • 探讨字幕系统与视频内容之间的自然匹配问题,以避免字幕与视频语境脱节。

总结

本文研究了一种针对听障人士的创新型字幕系统,能够通过视觉元素细致表现语音中的副语言信息。尽管系统在视觉舒适性和设计精细化方面仍有待改进,但其显著提高了听障人士在视频内容语音访问中的感知能力和用户体验,为未来字幕系统设计提供了重要启示。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/96390/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581130
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
语音可访问性、听觉障碍者支持(字幕、手语、振动)、通用设计与包容性设计
work
职业/产业
语言治疗师与听觉学家、残障服务提供者
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文