LipType:结合独立修复模型的无声语音识别器

手部手势识别语音可访问性运动障碍辅助输入技术残障服务提供者辅助技术专家

文献标题

LipType: A Silent Speech Recognizer Augmented with an Independent Repair Model

文献信息

  • 主题领域: 人机交互、静音语音识别、深度学习技术
  • 关键词: 静音语音识别,深度学习,语言模型,文本输入,错误修正

研究背景与问题

  • 作者发现了哪些问题或挑战?

    • 传统语音识别技术在嘈杂环境中表现不佳,同时可能涉及隐私和安全问题。
    • 静音语音识别可以缓解这些问题,但现有的静音语音识别器(例如LipNet)表现不稳定,在光照条件差、说话速度和口音变化时问题更严重。
    • 开发新的识别器和收集新的数据集需要大量的时间和资源。
  • 为什么这个问题很重要?

    • 静音语音识别可以帮助无法说话或有语言障碍的人更自然地与其他人和技术交互,提高技术的可访问性。
    • 增强语音识别系统可以在各种计算机交互中作为一种更可靠的输入媒介。
  • 研究动机与相关工作

    • 通过改进LipNet并引入一种独立修复模型,解决由于光照条件差和识别错误引起的问题。
    • 作者借鉴了包括静音语音识别、低光增强、错误校正以及移动设备上的静音交互等相关领域的研究成果。

解决方案

  • 作者提出了哪些方法或解决方案?

    • 开发了LipType,一个优化版的LipNet,旨在提高识别速度和准确性。
    • 构建了一种独立的修复模型,包括预处理(光照增强)和后处理(错误自动校正)。
  • 该解决方案的创新之处是什么?

    • 将浅层3D卷积神经网络(3D-CNN)与深度2D ResNet结合,通过“Squeeze and Excitation”模块增强通道间的信息捕获。
    • 使用深度降噪自动编码器(DDA)和改进的语言模型进行识别错误校正。
    • 提出了一个光照增强网络,利用新的损失函数减少输入视频中的亮度问题。
  • 实施步骤是什么?使用了哪些关键技术?

    1. LipType模型开发:
      • 将LipNet替换为浅层3D-CNN与深度2D SE-ResNet的混合结构。
      • 使用双向门控循环单元(Bi-GRU)对序列进行建模,并用Beam Search进行解码。
      • 模型在GRID数据集上进行训练和评价。
    2. 修复模型开发:
      • 预处理模块通过GLADNet增强低光控制的输入视频,采用MSSSIM-L1损失函数优化模型。
      • 后处理模块使用DDA校正字符序列错误,并结合双向语言模型预测最优句子序列。
    3. 实验评估:
      • 使用不同标准(如Word Error Rate, WER,Words Per Minute, WPM,Computation Time, CT)比较LipType与LipNet性能,以及修复模型对多个模型的增强能力。

研究成果

  • 取得了哪些具体成果?

    • LipType相比LipNet:
      • WER减少47%,WPM增加39%,CT减少8.6秒。
    • 修复模型显著降低了所有被测试识别器的WER,并略微增加了计算时间。
      • 静音语音识别的WER平均下降57.2%。
      • 语音识别的WER平均下降32%。
  • 与现有解决方案相比,它有哪些优势?

    • 修复模型独立于具体的识别器框架,可适用于多种语音和静音语音识别器。
    • 在嘈杂环境和光照条件差的情况下表现良好。
    • LipType模型在计算开销更少的情况下达到了更好的识别精度。
  • 实验或评估结果是什么?

    • 修复模型有效改善了多个识别器的性能,包括LipNet、LipType、Transformer以及DeepSpeech、Kaldi、Wave2Letter。
    • 修复后的识别器在不同的环境(如光照条件、噪声条件以及数据类型)下均表现显著提升。
  • 局限性与未来方向

    • 局限性:
      • 静音语音识别在未见数据上的性能与训练数据的分类范围有限相关,例如GRID数据集的词汇量较小。
    • 未来方向:
      • 进一步优化算法以提高效率。
      • 特别为具有言语障碍的人定制适配方案。
      • 扩展到头戴式显示器和智能眼镜等其他设备平台。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/47623/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445565
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
手部手势识别、语音可访问性、运动障碍辅助输入技术
work
职业/产业
残障服务提供者、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文