Radio2Text:使用毫米波射频信号的流式语音识别
基于毫米波(mmWave)的语音识别为音频相关应用提供了更多可能性,例如会议语音转录和窃听。然而,考虑到实际场景中的实用性,延迟和可识别词汇量是两个不可忽视的关键因素。在本文中,我们提出了 Radio2Text,这是第一个用于词汇量超过 13,000 词的流式自动语音识别(ASR)的毫米波系统。Radio2Text 基于定制的流式 Transformer,能够有效学习语音相关特征的表示,为大词汇量流式 ASR 铺平了道路。为了缓解流式网络无法访问完整未来输入的缺陷,我们提出了指导初始化(Guidance Initialization),通过权重继承促进将非流式 Transformer 中与全局上下文相关的特征知识转移到定制的流式 Transformer。此外,我们提出了基于知识蒸馏(KD)的跨模态结构,称为跨模态 KD,以减轻低质量毫米波信号对识别性能的负面影响。在跨模态 KD 中,音频流式 Transformer 提供特征和响应指导,将丰富且准确的语音信息传递给定制的射频流式 Transformer 以监督其训练。实验结果表明,对于超过 13,000 词的词汇量识别,Radio2Text 可以达到 5.7% 的字符错误率和 9.4% 的词错误率。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 100%
用户特征和偏好对使用不熟悉的声音用户界面性能的影响
CHI '19· 语音用户界面(VUI)设计 +1
- 100%
ProxiMic:通过单麦克风检测靠近麦克风的语音实现方便的语音激活
CHI '21· 语音用户界面(VUI)设计 +1
- 100%
Firefox Voice:一个基于网络的开放且可扩展的语音助手
CHI '21· 语音用户界面(VUI)设计 +1
- 100%
Aware: 使用韵律进行自然语音交互的直观设备激活
CHI '22· 语音用户界面(VUI)设计 +1
- 100%
通过声音寻找灵魂伴侣:理解基于在线同步声音的移动约会应用的承诺与挑战
CHI '24· 语音用户界面(VUI)设计 +1
- 100%
重写脚本:为语音交互改编文字指令
DIS '23· 语音用户界面(VUI)设计 +1
- 100%
SilentVoice: 通过内吸语音实现不易察觉的语音输入
UIST '18· 语音用户界面(VUI)设计 +1
- 100%
仅需开口:使用智能语音助手减少文本编辑的认知负荷
UIST '21· 语音用户界面(VUI)设计 +1
- 100%
基于应用的任务快捷方式 for 虚拟助手
UIST '21· 语音用户界面(VUI)设计 +1
- 67%
比较智能手机语音识别和触摸屏输入法在创作和转录中的应用
CHI '20· 语音用户界面(VUI)设计 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)