EchoSpeech:基于声学传感的最小侵扰式眼镜上的连续无声语音识别

振动反馈与皮肤刺激语音用户界面(VUI)设计生物传感器与生理监测AI/ML 研究员与工程师辅助技术专家

文献标题

EchoSpeech: Continuous Silent Speech Recognition on Minimally-obtrusive Eyewear Powered by Acoustic Sensing

文献信息

  • 主题领域: 人机交互、语音识别、无声语音接口
  • 关键词: 无声语音识别, 声学传感, 智能眼镜, 连续语音识别, 深度学习, 微型传感器, 低功耗, 人机界面

研究背景与问题

  • 问题与挑战:

    • 无声语音接口(Silent Speech Interface, SSI)允许用户无需发声,是一种可以适用于嘈杂环境或需要保持安静的场合的重要人机交互技术。
    • 当前的无声语音识别技术存在多种限制,例如基于摄像头的方法需要明确的前摄视角并引发隐私问题,而接触式传感器(如贴在嘴部或下巴的传感器)则存在物理不适和长时间佩戴不便的问题。
    • 现有设备通常只能识别有限命令词,且对连续语音的识别能力不足。
  • 重要性:

    • 无声语音接口可以扩展语音助手的应用场景,如在共享空间中输入密码或进行静默控制。
    • 提供一种可穿戴且最小侵入性的解决方案,可以克服现有技术中的物理和社会舒适性问题。
  • 研究动机与相关工作:

    • 现有研究尝试采用后耳、下巴后方或耳内装置,但信号质量受限;基于相机的方法则存在便携性和隐私问题,声学传感技术因此成为一个有潜力的研究方向。
    • 最早的研究如SpeeChin和EarCommand虽展示了一些能力,但在语音识别速度、跨会话性能和自然风格的连贯语音识别上仍有不足。

解决方案

  • 方法与解决方案:

    • 提出了一种名为EchoSpeech的解决方案,通过在商业现成眼镜框架(glass-frame)上安装声学传感器(扬声器和麦克风)实现无接触、低功耗的无声语音识别。
    • 设计了一套基于深度学习的自定义管道,利用连接时间分类(CTC)损失函数,可以在无需手动分割语音的情况下实现连续和离散语音识别。
    • 提出了“预训练+微调”的两步训练方案,以最小化用户的数据提供需求。
  • 创新点:

    1. 硬件创新: 首次在单个眼镜框架上实现非接触式的无声语音接口。
    2. 算法创新: 基于卷积神经网络(CNN)的分割无关语音识别管道。
    3. 鲁棒性设计: 在包括步行和噪声注入的复杂场景中进行评估。
  • 实施步骤与技术关键:

    1. 硬件设计:
      • 在眼镜框架的两侧安装两组扬声器和麦克风,形成四条主要声反射路径。
      • 使用频率调制连续波(FMCW)信号和差分回波分析捕捉面部运动模式。
    2. 深度学习模型:
      • 使用ResNet-18作为CNN编码器。
      • 采用CTC损失函数处理变长序列的时序对齐问题。
    3. 实验与优化:
      • 数据增强(如随机噪声、移动场景噪声模拟)提升模型鲁棒性。
      • 用户个性化微调,以减少训练时间和提升精准度。

研究成果

  • 具体成果:

    • 在31个孤立命令词下,平均词错误率(WER)为4.5%(标准差3.5%);在3-6位连续数字输入任务中,WER为6.1%(标准差4.2%)。
    • 测试了系统在行走和复杂噪声环境中的表现,显示了较强的鲁棒性。
  • 与现有解决方案的比较:

    • 相较于现有SSI方法(如基于摄像头、耳后传感器或贴附式传感器的方法),EchoSpeech具备更高的舒适性,且无直接接触皮肤,社会接受度更高。
    • 在耗能方面,该系统功耗为73.3mW,远低于基于摄像头的方法(如SpeeChin的2.4W)。
  • 实验与评估结果:

    • 通过滑动窗口机制实现了分割无关的连续预测。
    • 在步行环境下(未额外训练)表现为16.8%的WER;经过数据增强和少量训练数据(6-8分钟)的微调后,WER可降至8.7%。
    • 在输入速度和序列长度变化下,系统表现稳定。
  • 局限性与未来方向:

    • 局限性:
      1. 缺乏对眼镜推拉等操作的抗噪处理。
      2. 某些面部形状的用户可能存在佩戴不稳定。
      3. 系统的功耗和环境噪声的综合优化仍有改进空间。
    • 未来方向:
      1. 推动更广泛的数据收集以提升跨用户泛化性。
      2. 集成更灵活的激活机制以节省功耗。
      3. 进一步优化设备的隐形设计,提升社会接受度。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/96520/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3580801
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
振动反馈与皮肤刺激、语音用户界面(VUI)设计、生物传感器与生理监测
work
职业/产业
AI/ML 研究员与工程师、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文