ProxiMic:通过单麦克风检测靠近麦克风的语音实现方便的语音激活
作者
语音用户界面(VUI)设计智能语音助手(Alexa、Siri 等)
文献标题
ProxiMic: Convenient Voice Activation via Close-to-Mic Speech Detected by a Single Microphone
文献信息
- 主题领域: 人机交互 (Human-Computer Interaction)、语音激活技术
- 关键词: 声音输入, 传感技术, 活动识别, 靠近麦克风语音, 隐私保护, 用户体验, 机器学习, 人机交互, 感知技术, 弱势环境检测
研究背景与问题
- 问题与挑战:
- 语音输入面临三个主要挑战:唤醒时间过长、多轮交互过程繁琐且令人烦躁、语音隐私存在泄露风险。
- 虽然现有方法如“Raise to Speak”和“PrivateTalk”在缩短唤醒时间上有所突破,但它们依赖多种传感器或特定硬件格式,限制了应用范围。
- 传统隐私保护方法如静音语音(silent speech)虽然有效,但设备复杂且支持的语义范围有限,未被广泛采用。
- 问题重要性:
- 随着语音输入技术的普及,解决语音隐私和交互体验问题对于进一步增强用户体验具有重要意义。
- 研究动机与相关工作:
- 提供一种非唤醒、低成本的语音输入方法,解决唤醒词、繁琐交互和隐私问题。
- 提出的技术可以适配各种设备形式,且无需额外传感器或特殊设备。
解决方案
- 方法或解决方案:
- 提出了名为ProxiMic的技术,用单麦克风通过检测"靠近麦克风语音"实现无唤醒词激活,并支持用户在多个轮次对话中直接进行语音交互。
- 使用CNN(卷积神经网络)检测“气爆音”(pop noise)和其他微弱的近麦克风特征。
- 设计了双阶段算法:
- 第一阶段采用自适应幅度阈值触发器 (Adaptive Amplitude Threshold Trigger, AATT) 筛选出潜在的近麦克风语音信号。
- 第二阶段通过CNN检测是否为近麦克风语音,从而进一步精确识别。
- 创新之处:
- 利用气爆音这一声音特征,创新性地应用于语音激活,而无需多传感器支持。
- 提出并优化了两阶段检测算法,兼顾高准确率、低功耗和低内存使用。
- 实施步骤与关键技术:
- AATT: 动态监测环境背景声音能量,筛选高振幅的潜在信号。
- CNN: 基于声音谱图特征(低频增强谱图),细化并区分近麦克风语音信号。
- 实验中使用了多种设备环境模拟真实场景数据,并验证对复杂背景声音的鲁棒性。
研究成果
- 具体成果:
- 成功实现了94.1%的激活召回率及12.3次每周用户误接受频率(False Accepts per Week per User)。
- 在实验中显示ProxiMic适配多种设备形式(如智能手机、手表、耳机等),且环境鲁棒性较高。
- 优势:
- 不需要特殊手势或额外传感器,低成本易部署。
- 显著提升了语音输入的隐私性,支持用户可用低音量或耳语进行语音命令。
- 与现有算法(例如 "Raise to Speak")相比,具有更优的记忆占用和处理效率。
- 实验或评估结果:
- 用户实验表明,相较于传统唤醒词、按键激活等方式,ProxiMic具有更高的效率评价和用户满意度。
- ASR实验结果显示,即使包含气爆音或耳语低音量,语音转录准确率仍较高。
- 局限性与未来方向:
- 多设备适配需要更多的数据训练和测试以支持多种硬件封装形式。
- 针对耳语的语义识别优化,以及进一步降低误触发频率是未来研究的重要方向。
- 支持更复杂语言环境和恶劣声学场景的鲁棒性有待进一步提升。
结论
该研究提出了一种创新性且高效的近麦克风语音激活技术,解决了传统唤醒和语音输入方式中存在的交互复杂性与隐私问题。通过实验证明,ProxiMic能够显著提升用户体验,并具有广阔的应用场景潜力,例如隐私敏感场景、物联网设备语音交互等。研究为未来的语音输入技术发展提供了启示,同时指出多设备适配和功能扩展的挑战及机遇。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何通过单一麦克风检测近距离讲话实现免唤醒语音激活?分类: 无声语音、耳语与唇动交互同类问题arrow_forward
- 如何利用“噗噗音”改进传统语音激活系统的精准性和隐私保护?分类: 无声语音、耳语与唇动交互同类问题arrow_forward
- 在复杂声学环境中,如何确保近距离麦克风语音检测的鲁棒性?分类: 无声语音、耳语与唇动交互同类问题arrow_forward
lightbulb
现实痛点
1- 用户使用语音输入时可能面临复杂交互和隐私泄露的困境。分类: 无声语音、耳语与唇动交互同类问题arrow_forward
- 100%
用户特征和偏好对使用不熟悉的声音用户界面性能的影响
CHI '19· 语音用户界面(VUI)设计 +1
- 100%
Firefox Voice:一个基于网络的开放且可扩展的语音助手
CHI '21· 语音用户界面(VUI)设计 +1
- 100%
Aware: 使用韵律进行自然语音交互的直观设备激活
CHI '22· 语音用户界面(VUI)设计 +1
- 100%
通过声音寻找灵魂伴侣:理解基于在线同步声音的移动约会应用的承诺与挑战
CHI '24· 语音用户界面(VUI)设计 +1
- 100%
重写脚本:为语音交互改编文字指令
DIS '23· 语音用户界面(VUI)设计 +1
- 100%
Radio2Text:使用毫米波射频信号的流式语音识别
UbiComp '23· 语音用户界面(VUI)设计 +1
- 100%
SilentVoice: 通过内吸语音实现不易察觉的语音输入
UIST '18· 语音用户界面(VUI)设计 +1
- 100%
仅需开口:使用智能语音助手减少文本编辑的认知负荷
UIST '21· 语音用户界面(VUI)设计 +1
- 100%
基于应用的任务快捷方式 for 虚拟助手
UIST '21· 语音用户界面(VUI)设计 +1
- 67%
比较智能手机语音识别和触摸屏输入法在创作和转录中的应用
CHI '20· 语音用户界面(VUI)设计 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445687
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
语音用户界面(VUI)设计、智能语音助手(Alexa、Siri 等)
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文