NasoVoce:用于随时可用语音交互的鼻挂低可听性语音界面

智能语音助手(Alexa、Siri 等)情感化人机对话环境感知与上下文计算UI/UX 设计师AI/ML 研究员与工程师软件工程师与开发者

文献标题

NasoVoce: A Nose-Mounted Low-Audibility Speech Interface for Always-Available Speech Interaction

出版信息

  • 主题领域: 用于人工智能语音交互的静音和耳语语音接口
  • 关键词: 静音语音, 耳语语音, 智能眼镜, 振动传感器, 麦克风, 噪声鲁棒性, 随时可用接口, 可穿戴技术, 语音识别, 多模态融合

背景与问题

  • 问题/挑战: 现有的静音和耳语语音系统难以在可穿戴性、静音性、噪声鲁棒性和词汇量之间取得平衡,限制了其在连续人工智能交互中的实用性。
  • 意义: 一个鲁棒、隐蔽且抗噪的语音接口可以实现低调且随时可用的人工智能对话,从而提升其在公共和嘈杂环境中的可用性。
  • 动机与相关工作: 之前的系统如神经肌肉传感器、唇读和骨传导设备在词汇量、噪声鲁棒性或可穿戴性方面存在局限性。耳语语音系统具有潜力,但对噪声高度敏感。本文通过提出一种新颖的多模态方法来解决这些问题。

解决方案

  • 提出的方法: NasoVoce,一种鼻梁安装的接口,集成了MEMS麦克风和MEMS振动传感器,用于捕捉空气传导和骨传导的语音信号。
  • 创新点:
    1. 在鼻梁上集成麦克风和振动传感器,用于在噪声环境下捕捉正常和耳语语音。
    2. 开发了一种双输入深度学习模型(D-DCCRN),融合麦克风和振动传感器信号以增强语音质量和识别准确性。
    3. 创建了一个包含噪声环境下耳语和正常语音的数据集及训练方法。
    4. 通过客观指标、主观评分和真实场景评估证明系统的实用性。
  • 流程与关键技术:
    1. 硬件: 将MEMS麦克风和振动传感器安装在智能眼镜的鼻托上,捕捉同步的音频和振动信号。
    2. 软件: D-DCCRN模型处理两种信号的实部和虚部,用于抗噪语音增强。
    3. 训练: 包含104小时麦克风和振动传感器配对录音的数据集,并加入噪声;损失函数包括音频增强和知识蒸馏。
    4. 评估: 自动语音识别(ASR)准确性、客观质量指标(PESQ, STOI)、主观评分(MUSHRA)以及真实场景测试。

结果

  • 具体发现:
    • D-DCCRN模型拥有438.25M参数,处理语音耗时136.9毫秒,仅需OpenAI Whisper处理时间的31.8%。
    • 增强语音在ASR准确性、PESQ和STOI指标上,在大多数噪声条件下均优于单独的麦克风和振动传感器输入。
    • MUSHRA评分显示,在各种噪声水平下,增强语音的评分始终高于仅麦克风或仅振动输入。
  • 相较基线的优势:
    • 增强语音识别准确性优于仅麦克风和仅振动输入,尤其是在嘈杂环境中。
    • 在捕捉耳语语音方面,优于Apple AirPods Pro 2的语音隔离功能。
  • 实验/评估:
    • ASR测试: 在噪声水平从−10 dB到+10 dB的条件下,对1,000个语句进行词错误率(WER)和字符错误率(CER)评估。
    • 客观指标: 比较麦克风、振动和增强信号的PESQ和STOI得分。
    • 主观评分: 50名参与者使用MUSHRA对音频质量进行评估。
    • 真实场景测试: 在咖啡馆、路边、火车和步行场景中录制语音。
  • 局限性与未来工作:
    • 在非常嘈杂的条件下,由于振动信号较弱,耳语语音识别性能下降。
    • 提议未来研究动态输入选择(麦克风、振动或两者结合),以适应环境噪声。
    • 生理差异(如鼻腔通气性)需要进行用户校准和适应。

总结

NasoVoce提出了一种新颖的鼻梁安装语音接口,结合麦克风和振动传感器,用于捕捉正常和耳语语音。该系统通过D-DCCRN模型实现多模态融合,在嘈杂环境下增强语音质量和识别准确性。评估结果表明,其性能优于单一输入和商业替代方案,展示了其在低调且随时可用的人工智能语音交互中的可行性。未来工作包括动态输入选择和解决生理差异问题。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222661/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791397
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
智能语音助手(Alexa、Siri 等)、情感化人机对话、环境感知与上下文计算
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师、软件工程师与开发者
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文