mSilent:基于商用毫米波雷达的通用语料库无声语音识别研究
无声语音识别(SSR)允许用户在不发出声音的情况下与设备对话,避免被窃听或打扰他人。与基于视频的方法相比,无线信号支持的SSR可以在用户佩戴口罩时工作,且隐私问题更少。然而,以前的无线系统研究仍不足,例如仅在规模非常有限的语料库中进行评估,仅能与数十个确定性命令进行交互。本文提出mSilent,一个基于毫米波(mmWave)的SSR系统,能够在包含数千个日常对话句子的通用语料库中工作。凭借强大的识别能力,mSilent不仅支持与助手进行更复杂的交互,还能在日常生活中实现更广泛的应用,如通信和输入。为了提取精细的关节运动特征,我们构建了一个信号处理管道,使用聚类选择算法分离关节运动手势并生成多尺度去趋势频谱图(MSDS)。为处理通用语料库的复杂性,我们设计了一个端到端深度神经网络,包含多分支卷积前端和基于Transformer的序列到序列后端。我们收集了包含21000个双模态数据(毫米波和视频)样本的1000个日常对话句子的通用语料库数据集。我们的评估表明,mSilent在1.5米距离处实现了9.5%的平均词错误率(WER),与最先进的基于视频的方法性能相当。我们还探索了mSilent在文本输入和车载助手两种典型场景中的部署,平均WER低于6%,展示了mSilent在日常应用中的潜力。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 如何利用COTS(现货商品)mmWave雷达实现通用语料的无声语音识别?分类: 无声语音、耳语与唇动交互同类问题arrow_forward
- 如何设计信号处理和深度学习方法以捕捉精细的声带和口部运动特征?分类: 无声语音、耳语与唇动交互同类问题arrow_forward
- 如何通过用户自适应学习解决用户个体间的差异以提升识别精度?分类: 无声语音、耳语与唇动交互同类问题arrow_forward
现实痛点
1- 用户在嘈杂环境或戴口罩时难以实现隐私友好的语音交互。分类: 无声语音、耳语与唇动交互同类问题arrow_forward
- 67%
用户特征和偏好对使用不熟悉的声音用户界面性能的影响
CHI '19· 语音用户界面(VUI)设计 +1
- 67%
ProxiMic:通过单麦克风检测靠近麦克风的语音实现方便的语音激活
CHI '21· 语音用户界面(VUI)设计 +1
- 67%
Firefox Voice:一个基于网络的开放且可扩展的语音助手
CHI '21· 语音用户界面(VUI)设计 +1
- 67%
Aware: 使用韵律进行自然语音交互的直观设备激活
CHI '22· 语音用户界面(VUI)设计 +1
- 67%
通过声音寻找灵魂伴侣:理解基于在线同步声音的移动约会应用的承诺与挑战
CHI '24· 语音用户界面(VUI)设计 +1
- 67%
语音用户界面对话伙伴模型的跨文化验证
CUI '24· 语音用户界面(VUI)设计 +1
- 67%
重写脚本:为语音交互改编文字指令
DIS '23· 语音用户界面(VUI)设计 +1
- 67%
Radio2Text:使用毫米波射频信号的流式语音识别
UbiComp '23· 语音用户界面(VUI)设计 +1
- 67%
SilentVoice: 通过内吸语音实现不易察觉的语音输入
UIST '18· 语音用户界面(VUI)设计 +1
- 67%
仅需开口:使用智能语音助手减少文本编辑的认知负荷
UIST '21· 语音用户界面(VUI)设计 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)