WESPER:基于耳语的语音交互的零样本和实时耳语到正常语音转换

智能语音助手(Alexa、Siri 等)语音可访问性语言治疗师与听觉学家

文献标题

WESPER: Zero-shot and Realtime Whisper to Normal Voice Conversion for Whisper-based Speech Interactions

文献信息

  • 主题领域: 人机语音交互、语音转换、听力与语言障碍辅助技术
  • 关键词: 语音交互、耳语语音、耳语转换、人工智能、语音识别、自监督学习、语音重建

研究背景与问题

  • 作者发现的问题或挑战:

    • 使用语音指令在公共场所可能导致隐私问题或社交不适。
    • 在会议通话等场景中,可能存在对环境干扰和信息泄露的风险。
    • 对于语音或听力障碍的人,他们的语音可能由于生理原因而无法被理解或听清。
    • 传统的语音转换技术通常需要成对的耳语与正常语音数据集,训练成本高且存在用户依赖性。
  • 为什么这个问题重要:

    • 语音交互技术的社会接受度低,亟需发展更隐私、有效且无障碍的解决方案。
    • 改善耳语语音转换质量可以提高听力或语音障碍者的沟通能力,增强技术的社会意义。
  • 研究动机与相关工作:

    • 研究中的耳语语音识别技术面临设备需求高、数据集难以构建、识别词汇量受限等问题。
    • 特殊技术(如SilentVoice)虽然提出了创新的交互方式,但仍需特殊硬件和训练数据。
    • 作者提出了一种新的解决方案,以解决传统耳语语音转换面临的这些技术障碍。

解决方案

  • 方法或解决方案: 作者提出了一种名为WESPER的零样本、实时耳语到正常语音转换机制,基于自监督学习架构。它包含两个主要模块:

    • STU编码器: 将耳语或正常语音转换为公共语音单元。
    • UTS解码器: 从公共语音单元重建目标语音(正常语音)。
  • 创新之处:

    • 无需成对的耳语和正常语音数据集,仅使用非配对且无标签数据即可完成训练。
    • 转换过程与用户无关(speaker-independent),无需对每个用户单独训练。
    • 能够保持语音的自然韵律(prosody)并提升转换语音的质量。
  • 实施步骤和关键技术:

    1. STU编码器训练:
      • 使用HuBERT模型进行自监督预训练,减少耳语与正常语音之间的差距。
      • 利用未配对的耳语与正常语音数据生成公共语音单元。
      • 提供高维向量来表示语音特征。
    2. UTS解码器训练:
      • 基于FastSpeech2模型(修改版),无需对语音进行文本标注。
      • 直接从STU生成的公共语音单元重建目标语音。
      • 利用HiFi-GAN生成高质量音频。

研究成果

  • 具体成果:

    • 提出了一种实时且零样本语音转换技术,验证了其对正常语音和特殊音障问题的效果。
    • 对比传统技术,WESPER显著减少了耳语与正常语音的差异,实验显示转换的语音质量更好。
  • 与现有解决方案相比的优势:

    • 无需依赖成对的耳语和正常语音数据集,也不需要文本标注。
    • 能够在实时条件下完成语音转换。
    • 在实验中验证了对正常用户及听力与语言障碍者的效果显著提升。
  • 实验或评估结果:

    • 正常耳语到普通语音转换:
      • 通过Mean Opinion Score (MOS)和MUSHRA的评估,确认WESPER转换的语音质量较耳语显著改善,同时保持韵律自然性。
    • 语音重建及听力障碍者测试:
      • 对患有声带息肉、痉挛性发音障碍者的语音转换,MOS和MUSHRA评分均显著提高,语音质量和自然性提升。
      • 对听力障碍者的语音重建测试显示一定程度的质量改进,但韵律一致性仍较弱。
  • 局限性与未来方向:

    • 对于听力障碍者语音韵律不一致问题,未来可以尝试结合用户定制化小规模微调。
    • 探索更加精细的语音输入设备,如非可听性低音振动检测器,以进一步优化语音采集。
    • 考察其多语言转换能力,尤其针对其他非英语语音数据集等场景。
    • 探索与其他人工智能或人机交互系统的融合,以提升用户体验和技术可用性。

通过以上研究,WESPER展示了人工智能与语音交互技术在解决生理问题及提升社会隐私领域的巨大潜力。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/96115/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3580706
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
1 位作者
sell
研究子方向
智能语音助手(Alexa、Siri 等)、语音可访问性
work
职业/产业
语言治疗师与听觉学家
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文