字幕中语音韵律和情感的可视化:为聋人和重听用户提供无障碍服务
作者
语音可访问性听觉障碍者支持(字幕、手语、振动)通用设计与包容性设计语言治疗师与听觉学家残障服务提供者
文献标题
Visualization of Speech Prosody and Emotion in Captions: Accessibility for Deaf and Hard-of-Hearing Users
文献信息
- 主题领域: 可访问性技术、语音情感与韵律可视化
- 关键词: 可访问性, 情感计算, 助听技术, 聋人与听力障碍者, 语音韵律, 视觉文本
研究背景与问题
-
发现的问题或挑战:
- 自动生成的字幕通常无法表达语音中的情感和重点信息,使得聋人和听力障碍(DHH)用户在在线会议中时常无法理解对话的整体语义或语气。
- 现有的字幕设计缺乏对语音韵律(音量、音调、速度)和情感信息的视觉化表示,导致字幕过于单调且不具有吸引力。
-
重要性:
- 自动字幕已经成为聋人和听力障碍用户线上会议的重要工具,但这些字幕设计的不完善会限制他们的参与感和互动效率,尤其是在涉及情感和重点表达的语音交流中。
-
研究动机与相关工作:
- 研究旨在探索如何通过视觉化语音韵律和情感信息,改善字幕的表达效果,从而使字幕在工作和个人会议中对 DHH 用户更加包容和有效。
- 此前的相关研究几乎未涉及实时视频会议中的韵律和情感可视化问题,现有工作集中在预录内容的处理或音频建模方面。
解决方案
-
提出的解决方案:
- 开发三种新的字幕模型以超越传统的文本字幕:
- 表示语音韵律的模型(包括音量、音调和持续时间)。
- 表示语音情感的模型(基于愉悦度和唤醒度的二维情感模型)。
- 同时表示语音韵律和情感的整合模型。
- 开发三种新的字幕模型以超越传统的文本字幕:
-
创新之处:
- 新的字幕模型通过实时分析语音信号的声学特性,用视觉方式表达情感和重点信息。
- 提供了基于字体样式(如字体粗细、颜色、基线偏移、字母间距)的视觉标记以表示韵律和情感。
-
实施步骤与技术:
- 第一步:通过自动语音识别和声学分析提取韵律特征(音量、音调、持续时间)。
- 第二步:基于 Transformer 的神经网络模型分析情感特征(愉悦度和唤醒度)。
- 第三步:设计用于实时字幕显示的改进排版,包括动态字体样式以及颜色映射,进行实时渲染。
研究成果
-
具体成果:
- 通过两项实证研究:
- 第一项研究采访了8位聋人和听力障碍用户,发现当前字幕系统的缺陷以及他们对镶嵌情感和韵律的字幕模型的需求。
- 第二项研究测试了16位 DHH 用户对不同字幕模型的接受度和理解度,评估了新模型在情感和强调信息表达上的效果。
- 结果表明,情感模型(Emotion模型)在表达情感和强调信息方面显著优于传统字幕,而韵律模型则在强调信息表达方面不及传统模型。
- 通过两项实证研究:
-
与现有解决方案相比优势:
- 新的字幕模型能更好的捕捉语音中的情感变化(例如从积极到消极的转换),显著减少字幕所导致的交流模糊性。
- 虽然在易读性上略逊于传统字幕,但情感模型(Emotion)在传递故事情感上表现更优,能够更好地吸引用户注意力。
-
实验或评估结果:
- 用户在“清楚识别情感和语气”这一维度上对情感字幕的评分显著高于传统字幕。
- 同时,用户也认为情感模型更适合个人会议,而传统字幕更适用于工作场景。
-
局限性与未来方向:
-
局限性:
- 字体设计的易读性问题:某些字体样式(如基线偏移及字母间距变化)可能会降低字幕的可读性。
- 对色盲用户的适配问题:当前字幕模型的颜色方案可能对色盲用户区分度较低。
- 未充分考虑用户在不同场景(例如面部表情不可见的情况下)下对字幕的利用效果。
-
未来方向:
- 优化色彩标记方案以增强对色盲用户的适配。
- 探索更精细的语音特征提取和显示粒度(例如基于音节或音素)。
- 加入由用户或演讲者控制的情感采集界面以提高交互体验。
- 进一步研究新字幕模型是否能提高沟通中的互动质量和沉浸感。
-
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何通过视觉化展示语音的韵律(音量、音调、速度)来提升字幕对聋人及重听用户的使用体验?分类: 字幕、语音转写与听障沟通辅助同类问题arrow_forward
- 如何通过视觉化展示情绪信息(基于情绪的正负性和激动性)改善在线会议字幕的表达能力?分类: 字幕、语音转写与听障沟通辅助同类问题arrow_forward
- 结合情绪和韵律的综合字幕模型是否优于传统字幕在表达情绪和重点方面的能力?分类: 字幕、语音转写与听障沟通辅助同类问题arrow_forward
lightbulb
现实痛点
1- 聋人及重听用户难以通过传统字幕获取语音中的情感和重点信息。分类: 字幕、语音转写与听障沟通辅助同类问题arrow_forward
- 100%
可见的细微差别:为聋人和重听人士可视化副语言语音线索的字幕系统
CHI '23· 语音可访问性 +2
- 83%
观看它,不要想象它:通过从聋哑观众那里收集更多生态有效的判断来创建更好的字幕遮挡指标
CHI '22· 语音可访问性 +2
- 80%
为聋人和听力障碍成人自动简化文本工具:词汇简化的益处及赋予用户自主权
CHI '20· 语音可访问性 +1
- 67%
不同阅读水平的聋人或重听用户对不完美字幕工具的评估方法
CHI '18· 语音可访问性 +1
- 67%
电视直播中用户如何体验字幕:质量指标仍然是一个挑战
CHI '24· 语音可访问性 +2
- 67%
皇室字幕:从聋人和重听个体的角度探索情感字幕的设计空间
CHI '24· 语音可访问性 +2
- 67%
编织声音信息以支持实时听觉环境的理解:与聋人用户共同设计
CHI '25· 语音可访问性 +2
- 67%
声音可访问性:与失语症患者共同展望可访问的音频媒体未来
CHI '25· 语音可访问性 +2
- 60%
面向带非手动标记的AI驱动的手语生成
CHI '25· 语音可访问性 +1
- 60%
因人而异:与失语症患者探索高度个性化的视听媒体无障碍干预措施
DIS '25· 语音可访问性 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581511
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
语音可访问性、听觉障碍者支持(字幕、手语、振动)、通用设计与包容性设计
work
职业/产业
语言治疗师与听觉学家、残障服务提供者
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文