CLARIS:来自耳语和构音障碍声音的清晰可理解语音

语音可访问性振动反馈与皮肤刺激语音用户界面(VUI)设计语言治疗师与听觉学家精神科医生与心理咨询师医生、护士、临床医生

文献标题

CLARIS: Clear and Intelligible Speech from Whispered and Dysarthric Voices

出版信息

  • 主题领域: 针对耳语和构音障碍语音的语音恢复
  • 关键词: 耳语语音,构音障碍语音,语音恢复,语音转换,个性化,多语言,韵律,可懂度,自回归建模,数据增强

背景与问题

  • 问题/挑战: 现有的语音到语音系统在处理耳语和构音障碍语音时存在困难,主要由于泛化能力不足、依赖手工设计的数据增强方法,以及无法应对严重语音障碍或跨语言场景。个性化和无对齐建模仍然是未充分探索的领域。
  • 重要性: 耳语和构音障碍语音阻碍了有效的沟通与可访问性,在个人和职业环境中都形成了障碍。解决这些问题可以实现包容性和自然的语音交互。
  • 动机与相关工作: 之前的研究(如 WESPER 和 DistillW2N)在使用自监督和生成模型进行耳语到语音转换方面取得了一定进展。然而,这些系统通常在处理未见过的说话人、口音和严重障碍时表现不佳。构音障碍语音系统在开放词汇设置中错误率较高,现有的增强方法会产生不自然的伪影。本文基于自监督学习和自回归建模的进展,试图填补这些空白。

解决方案

  • 提出的方法: CLARIS(Clear and Accessible Restoration of Impaired Speech),一种自回归语音到语音恢复框架,将耳语和构音障碍输入转换为自然且清晰的语音。
  • 创新点:
    1. 针对耳语和构音障碍语音转换的统一、无对齐架构,采用自回归 Transformer。
    2. 通过最少数据(15–30 分钟)实现跨语言和临床相关的个性化。
    3. 集成基于 TTS 的增强方法和真实-合成对齐判别器(RSAD),以在合成数据上实现鲁棒训练。
    4. 轻量化设计(40.71M 参数),支持实时推理。
  • 流程与关键技术:
    • 数据增强: 使用 VITS TTS 生成的合成非典型语音,从 15–30 分钟的真实数据扩展到数百小时。
    • AS2UT 编码器: 提取 mel 频谱特征,并通过辅助字符解码器和 CTC 监督预测语言单元。
    • RSAD: 通过对抗训练对齐真实和合成嵌入,以减轻域不匹配问题。
    • 单元到语音渲染器: 使用基于 HiFi-GAN 的声码器将预测单元转换为自然语音。

结果

  • 具体发现:
    • 在 wTIMIT 耳语数据集上实现了 12% 的 WER,在 TORGO 构音障碍语音数据集上实现了 31% 的 WER,优于 WESPER 和 DistillW2N 等基线。
    • 在印地语耳语数据上实现了 29.21% 的 WER,展示了跨语言泛化能力。
    • 个性化模型在 30 分钟微调数据下,将印度口音耳语的 WER 降至 12.63%,构音障碍语音的 WER 降至 38.21%。
  • 相较基线的优势:
    • 在可懂度、BLEU 和 ROUGE-L 分数上优于 ASR-TTS 流水线和 WESPER、DistillW2N 等最先进系统。
    • 在质量、可懂度和韵律的主观评分中显著提升。
  • 实验/评估:
    • 在英语耳语(wTIMIT)、印地语耳语和构音障碍语音(TORGO)数据集上进行基准测试。
    • 评估指标包括 WER、CER、BLEU、ROUGE-L 和主观 MOS 评分。
    • 评估了对未见说话人、口音和语言的泛化能力,以及在有限数据下的个性化能力。
  • 局限性与未来工作:
    • 主观评估主要依赖非障碍听众;未来研究应包括语音障碍人士。
    • 自回归设计相比非自回归模型限制了推理速度。
    • 目前聚焦于英语和印地语;未来工作应扩展至其他语言和障碍类型。

总结

CLARIS 是一种轻量化、无对齐的语音恢复框架,可将耳语和构音障碍语音转换为清晰、自然的输出。它在多个数据集和语言上实现了最先进的性能,并在未见说话人和口音上表现出强泛化能力。通过最少数据实现的个性化适配,使其适用于包容性和可访问的语音交互。未来工作将重点扩展至更多语言、障碍类型及实际部署场景。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222969/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791734
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
语音可访问性、振动反馈与皮肤刺激、语音用户界面(VUI)设计
work
职业/产业
语言治疗师与听觉学家、精神科医生与心理咨询师、医生、护士、临床医生
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文