ProxiMic:通过单麦克风检测靠近麦克风的语音实现方便的语音激活

语音用户界面(VUI)设计智能语音助手(Alexa、Siri 等)

文献标题

ProxiMic: Convenient Voice Activation via Close-to-Mic Speech Detected by a Single Microphone

文献信息

  • 主题领域: 人机交互 (Human-Computer Interaction)、语音激活技术
  • 关键词: 声音输入, 传感技术, 活动识别, 靠近麦克风语音, 隐私保护, 用户体验, 机器学习, 人机交互, 感知技术, 弱势环境检测

研究背景与问题

  • 问题与挑战:
    • 语音输入面临三个主要挑战:唤醒时间过长、多轮交互过程繁琐且令人烦躁、语音隐私存在泄露风险。
    • 虽然现有方法如“Raise to Speak”和“PrivateTalk”在缩短唤醒时间上有所突破,但它们依赖多种传感器或特定硬件格式,限制了应用范围。
    • 传统隐私保护方法如静音语音(silent speech)虽然有效,但设备复杂且支持的语义范围有限,未被广泛采用。
  • 问题重要性:
    • 随着语音输入技术的普及,解决语音隐私和交互体验问题对于进一步增强用户体验具有重要意义。
  • 研究动机与相关工作:
    • 提供一种非唤醒、低成本的语音输入方法,解决唤醒词、繁琐交互和隐私问题。
    • 提出的技术可以适配各种设备形式,且无需额外传感器或特殊设备。

解决方案

  • 方法或解决方案:
    • 提出了名为ProxiMic的技术,用单麦克风通过检测"靠近麦克风语音"实现无唤醒词激活,并支持用户在多个轮次对话中直接进行语音交互。
    • 使用CNN(卷积神经网络)检测“气爆音”(pop noise)和其他微弱的近麦克风特征。
    • 设计了双阶段算法:
      • 第一阶段采用自适应幅度阈值触发器 (Adaptive Amplitude Threshold Trigger, AATT) 筛选出潜在的近麦克风语音信号。
      • 第二阶段通过CNN检测是否为近麦克风语音,从而进一步精确识别。
  • 创新之处:
    • 利用气爆音这一声音特征,创新性地应用于语音激活,而无需多传感器支持。
    • 提出并优化了两阶段检测算法,兼顾高准确率、低功耗和低内存使用。
  • 实施步骤与关键技术:
    • AATT: 动态监测环境背景声音能量,筛选高振幅的潜在信号。
    • CNN: 基于声音谱图特征(低频增强谱图),细化并区分近麦克风语音信号。
    • 实验中使用了多种设备环境模拟真实场景数据,并验证对复杂背景声音的鲁棒性。

研究成果

  • 具体成果:
    • 成功实现了94.1%的激活召回率及12.3次每周用户误接受频率(False Accepts per Week per User)。
    • 在实验中显示ProxiMic适配多种设备形式(如智能手机、手表、耳机等),且环境鲁棒性较高。
  • 优势:
    • 不需要特殊手势或额外传感器,低成本易部署。
    • 显著提升了语音输入的隐私性,支持用户可用低音量或耳语进行语音命令。
    • 与现有算法(例如 "Raise to Speak")相比,具有更优的记忆占用和处理效率。
  • 实验或评估结果:
    • 用户实验表明,相较于传统唤醒词、按键激活等方式,ProxiMic具有更高的效率评价和用户满意度。
    • ASR实验结果显示,即使包含气爆音或耳语低音量,语音转录准确率仍较高。
  • 局限性与未来方向:
    • 多设备适配需要更多的数据训练和测试以支持多种硬件封装形式。
    • 针对耳语的语义识别优化,以及进一步降低误触发频率是未来研究的重要方向。
    • 支持更复杂语言环境和恶劣声学场景的鲁棒性有待进一步提升。

结论

该研究提出了一种创新性且高效的近麦克风语音激活技术,解决了传统唤醒和语音输入方式中存在的交互复杂性与隐私问题。通过实验证明,ProxiMic能够显著提升用户体验,并具有广阔的应用场景潜力,例如隐私敏感场景、物联网设备语音交互等。研究为未来的语音输入技术发展提供了启示,同时指出多设备适配和功能扩展的挑战及机遇。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/47424/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445687
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
语音用户界面(VUI)设计、智能语音助手(Alexa、Siri 等)
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文