字幕中语音韵律和情感的可视化:为聋人和重听用户提供无障碍服务

语音可访问性听觉障碍者支持(字幕、手语、振动)通用设计与包容性设计语言治疗师与听觉学家残障服务提供者

文献标题

Visualization of Speech Prosody and Emotion in Captions: Accessibility for Deaf and Hard-of-Hearing Users

文献信息

  • 主题领域: 可访问性技术、语音情感与韵律可视化
  • 关键词: 可访问性, 情感计算, 助听技术, 聋人与听力障碍者, 语音韵律, 视觉文本

研究背景与问题

  • 发现的问题或挑战:

    • 自动生成的字幕通常无法表达语音中的情感和重点信息,使得聋人和听力障碍(DHH)用户在在线会议中时常无法理解对话的整体语义或语气。
    • 现有的字幕设计缺乏对语音韵律(音量、音调、速度)和情感信息的视觉化表示,导致字幕过于单调且不具有吸引力。
  • 重要性:

    • 自动字幕已经成为聋人和听力障碍用户线上会议的重要工具,但这些字幕设计的不完善会限制他们的参与感和互动效率,尤其是在涉及情感和重点表达的语音交流中。
  • 研究动机与相关工作:

    • 研究旨在探索如何通过视觉化语音韵律和情感信息,改善字幕的表达效果,从而使字幕在工作和个人会议中对 DHH 用户更加包容和有效。
    • 此前的相关研究几乎未涉及实时视频会议中的韵律和情感可视化问题,现有工作集中在预录内容的处理或音频建模方面。

解决方案

  • 提出的解决方案:

    • 开发三种新的字幕模型以超越传统的文本字幕:
      1. 表示语音韵律的模型(包括音量、音调和持续时间)。
      2. 表示语音情感的模型(基于愉悦度和唤醒度的二维情感模型)。
      3. 同时表示语音韵律和情感的整合模型。
  • 创新之处:

    • 新的字幕模型通过实时分析语音信号的声学特性,用视觉方式表达情感和重点信息。
    • 提供了基于字体样式(如字体粗细、颜色、基线偏移、字母间距)的视觉标记以表示韵律和情感。
  • 实施步骤与技术:

    • 第一步:通过自动语音识别和声学分析提取韵律特征(音量、音调、持续时间)。
    • 第二步:基于 Transformer 的神经网络模型分析情感特征(愉悦度和唤醒度)。
    • 第三步:设计用于实时字幕显示的改进排版,包括动态字体样式以及颜色映射,进行实时渲染。

研究成果

  • 具体成果:

    • 通过两项实证研究:
      1. 第一项研究采访了8位聋人和听力障碍用户,发现当前字幕系统的缺陷以及他们对镶嵌情感和韵律的字幕模型的需求。
      2. 第二项研究测试了16位 DHH 用户对不同字幕模型的接受度和理解度,评估了新模型在情感和强调信息表达上的效果。
    • 结果表明,情感模型(Emotion模型)在表达情感和强调信息方面显著优于传统字幕,而韵律模型则在强调信息表达方面不及传统模型。
  • 与现有解决方案相比优势:

    • 新的字幕模型能更好的捕捉语音中的情感变化(例如从积极到消极的转换),显著减少字幕所导致的交流模糊性。
    • 虽然在易读性上略逊于传统字幕,但情感模型(Emotion)在传递故事情感上表现更优,能够更好地吸引用户注意力。
  • 实验或评估结果:

    • 用户在“清楚识别情感和语气”这一维度上对情感字幕的评分显著高于传统字幕。
    • 同时,用户也认为情感模型更适合个人会议,而传统字幕更适用于工作场景。
  • 局限性与未来方向:

    • 局限性:

      • 字体设计的易读性问题:某些字体样式(如基线偏移及字母间距变化)可能会降低字幕的可读性。
      • 对色盲用户的适配问题:当前字幕模型的颜色方案可能对色盲用户区分度较低。
      • 未充分考虑用户在不同场景(例如面部表情不可见的情况下)下对字幕的利用效果。
    • 未来方向:

      • 优化色彩标记方案以增强对色盲用户的适配。
      • 探索更精细的语音特征提取和显示粒度(例如基于音节或音素)。
      • 加入由用户或演讲者控制的情感采集界面以提高交互体验。
      • 进一步研究新字幕模型是否能提高沟通中的互动质量和沉浸感。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/95801/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581511
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
语音可访问性、听觉障碍者支持(字幕、手语、振动)、通用设计与包容性设计
work
职业/产业
语言治疗师与听觉学家、残障服务提供者
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文