可见的细微差别:为聋人和重听人士可视化副语言语音线索的字幕系统
语音可访问性听觉障碍者支持(字幕、手语、振动)通用设计与包容性设计语言治疗师与听觉学家残障服务提供者
文献标题
Visible Nuances: A Caption System to Visualize Paralinguistic Speech Cues for Deaf and Hard-of-Hearing Individuals
文献信息
- 主题领域: 可访问性技术,尤其是为听障人士设计的视频字幕系统
- 关键词: 字幕设计, 语音无障碍, 副语言线索, 听障人士, 情绪可视化, 视觉化, 音频可视化
研究背景与问题
- 当前字幕系统主要传递文字内容,忽略了语音的副语言线索(如语调、语气、强度),使得听障人士无法完全理解说话者的意图和情绪。
- 现有系统的一些改进(如手工输入情绪信息或通过特定显示方式呈现基本的音频特征)存在局限性:手动输入费时费力,且显示方式不足以表达复杂的语音情绪。
- 针对听障人士,通过字幕传递语音的副语言线索是一项重要但尚未完全解决的研究课题。
解决方案
- 总体方法: 提出一种音频可视化字幕系统,将语音中的副语言线索(音量、音高和情绪等)转化为视觉元素(如字幕字体的粗细、文字高度、字体风格和运动)。
- 创新之处:
- 首次在字幕中应用动态字体、文字运动等高级视觉元素来传递复杂语音的情绪和语调。
- 系统结合了音频分析算法和预定义的视觉映射规则。
- 实施步骤:
- 音频分离: 使用音源分离模型(Spleeter)提取视频中的人声。
- 特征提取与情绪分类: 将音频样本细分为音节单元,提取音量和音高特征,使用情绪分类器识别情绪。
- 字幕生成: 根据音频特征和情绪结果,映射字幕的字体风格、运动、厚度和高度,生成实时动态字幕。
- 关键技术:
- 音频分离技术
- 音量、音高特征标准化算法
- 复杂情绪的分类与映射设计
研究成果
- 具体成果:
- 实现了针对听障人士的动态字幕原型系统,能够在视频中用视觉化方式呈现语音副语言细节。
- 在20位听障参与者中验证该系统的实用性和用户体验。
- 与现有解决方案相比的优势:
- 能够更直观地传递情绪和语气,提高视频内容的语音可访问性。
- 在正式演讲视频中,能效地帮助听障者识别讲话者的语气和意图。
- 实验或评估结果:
- 在正式演讲视频中,使用高级字幕系统的参与者在识别讲话者意图上的准确性从22.5%提升到45%。
- 在情绪识别任务中,高级字幕系统使得听障者对细致的情绪子类(如讽刺、孤独等)的识别准确率提高了20%。
- 高级字幕系统在内容表达力和用户满意度上表现出显著优势,特别是对于不易通过面部表情解读语气的演讲视频。
- 局限性与未来方向:
- 局限性:
- 部分参与者对动态字幕系统的视觉干扰感到不适应,如字体运动带来的阅读疲劳。
- 当前情绪分类系统覆盖范围有限,仅包括6个情绪类别。
- 系统依赖人工情绪标注,未完全实现自动化。
- 未来方向:
- 优化字幕的设计,减少视觉负担(如优化字体风格和运动频率)。
- 扩展字幕系统的情绪分类能力,支持更细腻的情绪变化表达。
- 提高系统的自动化水平,开发实时情绪分类和音频分析模块。
- 探讨字幕系统与视频内容之间的自然匹配问题,以避免字幕与视频语境脱节。
- 局限性:
总结
本文研究了一种针对听障人士的创新型字幕系统,能够通过视觉元素细致表现语音中的副语言信息。尽管系统在视觉舒适性和设计精细化方面仍有待改进,但其显著提高了听障人士在视频内容语音访问中的感知能力和用户体验,为未来字幕系统设计提供了重要启示。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 现有字幕系统如何改进以传达语音的副语言(如语调和情感)信息给听力受损者?分类: 聋人、听障群体与手语/字幕支持同类问题arrow_forward
- 视觉元素(如字体厚度、文本高度、运动等)能有效地表现复杂的语音情感信息吗?分类: 聋人、听障群体与手语/字幕支持同类问题arrow_forward
- 动态字幕系统在增强听力受损者视频内容理解方面的效果如何?分类: 聋人、听障群体与手语/字幕支持同类问题arrow_forward
lightbulb
现实痛点
1- 听力受损者难以通过现有字幕系统理解语音的语调和情感。分类: 聋人、听障群体与手语/字幕支持同类问题arrow_forward
- 100%
字幕中语音韵律和情感的可视化:为聋人和重听用户提供无障碍服务
CHI '23· 语音可访问性 +2
- 83%
观看它,不要想象它:通过从聋哑观众那里收集更多生态有效的判断来创建更好的字幕遮挡指标
CHI '22· 语音可访问性 +2
- 80%
为聋人和听力障碍成人自动简化文本工具:词汇简化的益处及赋予用户自主权
CHI '20· 语音可访问性 +1
- 67%
不同阅读水平的聋人或重听用户对不完美字幕工具的评估方法
CHI '18· 语音可访问性 +1
- 67%
电视直播中用户如何体验字幕:质量指标仍然是一个挑战
CHI '24· 语音可访问性 +2
- 67%
皇室字幕:从聋人和重听个体的角度探索情感字幕的设计空间
CHI '24· 语音可访问性 +2
- 67%
编织声音信息以支持实时听觉环境的理解:与聋人用户共同设计
CHI '25· 语音可访问性 +2
- 67%
声音可访问性:与失语症患者共同展望可访问的音频媒体未来
CHI '25· 语音可访问性 +2
- 60%
面向带非手动标记的AI驱动的手语生成
CHI '25· 语音可访问性 +1
- 60%
因人而异:与失语症患者探索高度个性化的视听媒体无障碍干预措施
DIS '25· 语音可访问性 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581130
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
语音可访问性、听觉障碍者支持(字幕、手语、振动)、通用设计与包容性设计
work
职业/产业
语言治疗师与听觉学家、残障服务提供者
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文