CLARIS:来自耳语和构音障碍声音的清晰可理解语音
作者
语音可访问性振动反馈与皮肤刺激语音用户界面(VUI)设计语言治疗师与听觉学家精神科医生与心理咨询师医生、护士、临床医生
文献标题
CLARIS: Clear and Intelligible Speech from Whispered and Dysarthric Voices
出版信息
- 主题领域: 针对耳语和构音障碍语音的语音恢复
- 关键词: 耳语语音,构音障碍语音,语音恢复,语音转换,个性化,多语言,韵律,可懂度,自回归建模,数据增强
背景与问题
- 问题/挑战: 现有的语音到语音系统在处理耳语和构音障碍语音时存在困难,主要由于泛化能力不足、依赖手工设计的数据增强方法,以及无法应对严重语音障碍或跨语言场景。个性化和无对齐建模仍然是未充分探索的领域。
- 重要性: 耳语和构音障碍语音阻碍了有效的沟通与可访问性,在个人和职业环境中都形成了障碍。解决这些问题可以实现包容性和自然的语音交互。
- 动机与相关工作: 之前的研究(如 WESPER 和 DistillW2N)在使用自监督和生成模型进行耳语到语音转换方面取得了一定进展。然而,这些系统通常在处理未见过的说话人、口音和严重障碍时表现不佳。构音障碍语音系统在开放词汇设置中错误率较高,现有的增强方法会产生不自然的伪影。本文基于自监督学习和自回归建模的进展,试图填补这些空白。
解决方案
- 提出的方法: CLARIS(Clear and Accessible Restoration of Impaired Speech),一种自回归语音到语音恢复框架,将耳语和构音障碍输入转换为自然且清晰的语音。
- 创新点:
- 针对耳语和构音障碍语音转换的统一、无对齐架构,采用自回归 Transformer。
- 通过最少数据(15–30 分钟)实现跨语言和临床相关的个性化。
- 集成基于 TTS 的增强方法和真实-合成对齐判别器(RSAD),以在合成数据上实现鲁棒训练。
- 轻量化设计(40.71M 参数),支持实时推理。
- 流程与关键技术:
- 数据增强: 使用 VITS TTS 生成的合成非典型语音,从 15–30 分钟的真实数据扩展到数百小时。
- AS2UT 编码器: 提取 mel 频谱特征,并通过辅助字符解码器和 CTC 监督预测语言单元。
- RSAD: 通过对抗训练对齐真实和合成嵌入,以减轻域不匹配问题。
- 单元到语音渲染器: 使用基于 HiFi-GAN 的声码器将预测单元转换为自然语音。
结果
- 具体发现:
- 在 wTIMIT 耳语数据集上实现了 12% 的 WER,在 TORGO 构音障碍语音数据集上实现了 31% 的 WER,优于 WESPER 和 DistillW2N 等基线。
- 在印地语耳语数据上实现了 29.21% 的 WER,展示了跨语言泛化能力。
- 个性化模型在 30 分钟微调数据下,将印度口音耳语的 WER 降至 12.63%,构音障碍语音的 WER 降至 38.21%。
- 相较基线的优势:
- 在可懂度、BLEU 和 ROUGE-L 分数上优于 ASR-TTS 流水线和 WESPER、DistillW2N 等最先进系统。
- 在质量、可懂度和韵律的主观评分中显著提升。
- 实验/评估:
- 在英语耳语(wTIMIT)、印地语耳语和构音障碍语音(TORGO)数据集上进行基准测试。
- 评估指标包括 WER、CER、BLEU、ROUGE-L 和主观 MOS 评分。
- 评估了对未见说话人、口音和语言的泛化能力,以及在有限数据下的个性化能力。
- 局限性与未来工作:
- 主观评估主要依赖非障碍听众;未来研究应包括语音障碍人士。
- 自回归设计相比非自回归模型限制了推理速度。
- 目前聚焦于英语和印地语;未来工作应扩展至其他语言和障碍类型。
总结
CLARIS 是一种轻量化、无对齐的语音恢复框架,可将耳语和构音障碍语音转换为清晰、自然的输出。它在多个数据集和语言上实现了最先进的性能,并在未见说话人和口音上表现出强泛化能力。通过最少数据实现的个性化适配,使其适用于包容性和可访问的语音交互。未来工作将重点扩展至更多语言、障碍类型及实际部署场景。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791734
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
语音可访问性、振动反馈与皮肤刺激、语音用户界面(VUI)设计
work
职业/产业
语言治疗师与听觉学家、精神科医生与心理咨询师、医生、护士、临床医生
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文