注意你的嘴:使用深度感知的无声语音识别

荣誉提名
眼动追踪与注视交互认知障碍与神经多样性(自闭症、ADHD、阅读困难)

文献标题

Watch Your Mouth: Silent Speech Recognition with Depth Sensing

文献信息

  • 主题领域: 人机交互、深度学习、深度传感技术、无声语音识别
  • 关键词: 无声语音识别, 可视语音识别, 唇部阅读, 深度传感, 深度学习, 输入技术

研究背景与问题

  • 发现的问题或挑战: 传统无声语音识别技术依赖于RGB摄像头或其他传感技术(如超声成像和电磁传感器等),但这些技术受环境因素干扰较大(例如光线变化或设备方向改变),并存在隐私泄露风险。

  • 重要性: 无声语音识别技术可以实现私密的人机交互,尤其是在智能设备(智能手表、AR/VR眼镜或IoT设备)上的应用。随着大语言模型(LLM)的发展,这项技术可以大幅提升设备的交互能力,消除传统界面的限制。

  • 研究动机与相关工作: 深度传感器因其对光线变化不敏感、能够适应不同皮肤色调,以及设备位置变化时数据一致性较高,被认为是一种具有潜力的方式来解决上述挑战。然而,传统方法在不同设备位置之间缺乏泛化性,需要大量数据校准。作者提出基于深度传感器的无声语音识别技术来解决这一问题。

解决方案

  • 提出的方法或解决方案: 提出了一种基于深度传感器的新型无声语音识别方法 "Watch Your Mouth"。该方法通过深度数据来捕捉用户脸部的唇部运动,并通过深度学习管线(PointVSR)将点云数据转化为命令和句子。

  • 创新点:

    1. 首次将深度传感器用于无声语音识别,并排除了敏感的RGB数据。
    2. 通过转换深度图为点云数据,增强了模型对不同用户和设备位置变化的适应性。
    3. 提出了一个结合信号对齐、点云特征提取和时间序列解码的深度学习管线。
  • 实施步骤与关键技术:

    1. 数据采集: 使用iPhone TrueDepth相机捕捉用户唇部运动的深度数据。
    2. 唇部分割: 利用YOLOv7目标检测模型进行唇部区域提取,消除无关信息。
    3. 深度图转点云数据: 将深度图转换为三维点云,并计算法向量以增强局部特征。
    4. 深度学习管线设计:
      • 包括4D点云卷积层、Transformer层和Bi-GRU层,结合连接时序分类(CTC)损失完成句子和命令识别。
      • TNet模块进行点云对齐,以提高对不同设备位置的鲁棒性。

研究成果

  • 具体成果:

    1. 在三个传感器位置(腕戴设备、头戴设备、环境设备)中均表现出较高的识别准确性,证明了方法的可行性。
    2. 在命令识别中,平均准确率达到91.33%(用户内),在泛化到未见用户时,准确率仍达74.88%。
    3. 在句子识别上,用户内的字符错误率(CER)为4.13%,单词错误率(WER)为8.06%;用户间分别为18.28%和29.14%。
  • 与现有解决方案的比较:

    • 在用户内场景:CER和WER分别比主流RGB视频方法减少了48.05%和38.10%。
    • 在用户间场景:CER和WER分别减少了5%和4.57%。
    • 模型参数量更小(20M vs RGB模型的250M),训练效率更高。
  • 实验或评估结果: 命令和句子的识别错误主要集中在以下类型:

    • 替换错误(Substitution):占92.2%。
    • 删除错误(Deletion):占6.0%。
    • 插入错误(Insertion):占1.7%。
  • 局限性与未来方向:

    1. 人员样本量较少,建议未来扩大参与者规模以研究人口变异性对结果的影响。
    2. 系统部署尚限于实验室环境,未来需测试其在自然语言交互中的表现。
    3. 尚未测试中低端深度传感器性能,需进一步研究成本可接受性。
    4. 数据集规模较小,应开发大规模深度数据集用于增强模型性能。

结论

本文提出了一种基于深度传感器的无声语音识别技术,为智能设备提供了高效、可靠的输入方法。实验结果表明,本方法在命令和句子识别中均超越了基于RGB视频的传统方法,并证明了其在多种设备位置中的适应能力。研究进一步强调了深度传感器的隐私保护优势及潜在的社会适用性,同时为相关领域的后续研究开辟了新方向。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/147350/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642092
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
荣誉提名
group
作者
4 位作者
sell
研究子方向
眼动追踪与注视交互、认知障碍与神经多样性(自闭症、ADHD、阅读困难)
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文