Radio2Text:使用毫米波射频信号的流式语音识别

语音用户界面(VUI)设计智能语音助手(Alexa、Siri 等)

基于毫米波(mmWave)的语音识别为音频相关应用提供了更多可能性,例如会议语音转录和窃听。然而,考虑到实际场景中的实用性,延迟和可识别词汇量是两个不可忽视的关键因素。在本文中,我们提出了 Radio2Text,这是第一个用于词汇量超过 13,000 词的流式自动语音识别(ASR)的毫米波系统。Radio2Text 基于定制的流式 Transformer,能够有效学习语音相关特征的表示,为大词汇量流式 ASR 铺平了道路。为了缓解流式网络无法访问完整未来输入的缺陷,我们提出了指导初始化(Guidance Initialization),通过权重继承促进将非流式 Transformer 中与全局上下文相关的特征知识转移到定制的流式 Transformer。此外,我们提出了基于知识蒸馏(KD)的跨模态结构,称为跨模态 KD,以减轻低质量毫米波信号对识别性能的负面影响。在跨模态 KD 中,音频流式 Transformer 提供特征和响应指导,将丰富且准确的语音信息传递给定制的射频流式 Transformer 以监督其训练。实验结果表明,对于超过 13,000 词的词汇量识别,Radio2Text 可以达到 5.7% 的字符错误率和 9.4% 的词错误率。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/ubicomp/128401/2023

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
UbiComp
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
语音用户界面(VUI)设计、智能语音助手(Alexa、Siri 等)
work
职业/产业
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文