mSilent:基于商用毫米波雷达的通用语料库无声语音识别研究

语音用户界面(VUI)设计智能语音助手(Alexa、Siri 等)多语言与跨文化语音交互

无声语音识别(SSR)允许用户在不发出声音的情况下与设备对话,避免被窃听或打扰他人。与基于视频的方法相比,无线信号支持的SSR可以在用户佩戴口罩时工作,且隐私问题更少。然而,以前的无线系统研究仍不足,例如仅在规模非常有限的语料库中进行评估,仅能与数十个确定性命令进行交互。本文提出mSilent,一个基于毫米波(mmWave)的SSR系统,能够在包含数千个日常对话句子的通用语料库中工作。凭借强大的识别能力,mSilent不仅支持与助手进行更复杂的交互,还能在日常生活中实现更广泛的应用,如通信和输入。为了提取精细的关节运动特征,我们构建了一个信号处理管道,使用聚类选择算法分离关节运动手势并生成多尺度去趋势频谱图(MSDS)。为处理通用语料库的复杂性,我们设计了一个端到端深度神经网络,包含多分支卷积前端和基于Transformer的序列到序列后端。我们收集了包含21000个双模态数据(毫米波和视频)样本的1000个日常对话句子的通用语料库数据集。我们的评估表明,mSilent在1.5米距离处实现了9.5%的平均词错误率(WER),与最先进的基于视频的方法性能相当。我们还探索了mSilent在文本输入和车载助手两种典型场景中的部署,平均WER低于6%,展示了mSilent在日常应用中的潜力。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/ubicomp/128421/2023

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
UbiComp
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
语音用户界面(VUI)设计、智能语音助手(Alexa、Siri 等)、多语言与跨文化语音交互
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文