M^2Silent: 通过共享空间中的多方向扬声器实现多用户无声语音交互

眼动追踪与注视交互语音用户界面(VUI)设计隐私设计与用户控制

研究背景与问题

  • 发现的问题或挑战:作者发现当前的语音交互系统在多用户共享空间中存在隐私保护不足、噪声干扰严重以及不支持沉默语音交互的问题。在博物馆、车辆和办公室等场景中,用户不愿大声说话或存在隐私需求,这限制了语音控制系统的应用。此外,现有的沉默语音接口通常需要附加设备,如摄像头、毫米波雷达或穿戴设备,存在不便与高成本问题。
  • 重要性:随着语音控制设备的普及,隐私问题逐渐凸显。解决这一问题不仅可以扩展语音交互的应用场景,还能提高用户体验和社会接受度。
  • 研究动机与相关工作:尽管领域研究已经探索了多个方法(如基于电肌图、摄像检测或毫米波雷达的沉默语音识别),但这些方法通常仅限单用户设置,或是对隐私和便捷性的要求未得到满足。作者试图开发一种在共享环境中同时支持多用户交互且无需佩戴设备的解决方案。

解决方案

  • 提出的方案:作者提出了M2Silent系统,该系统结合了多方向扬声器、频率调制连续波(FMCW)信号和深度学习技术,实现了多用户同时沉默语音交互。其特点是整合了音频传输和沉默语音感知功能。
  • 创新之处:
    1. 首次将多方向扬声器与沉默语音交互相结合,支持多用户同时进行设备无接触的交互。
    2. 用FMCW信号作为音频载波来同时进行语音播放与用户环绕感知。
    3. 提出时间偏移FMCW信号和盲信号分离算法以分解多用户的沉默语音特征。
    4. 使用滑动窗口和深度残差模型SilentMatch实现实时和句子级的沉默语音识别。
  • 实施步骤:
    1. 调制音频为FMCW信号,并通过空气非线性进行解调以实现清晰的音频播放。
    2. 通过时间偏移将信号分配到不同方向以区分用户特征,并应用盲信号分离技术隔离用户特征。
    3. 使用SilentMatch深度学习模型进行词级别和句子级语音识别。
    4. 在实时交互中采用滑动窗口方法处理单词串,确保流畅的交互。

研究成果

  • 具体成果:
    1. 实现了设备无接触式的多用户同时沉默语音交互。
    2. 在真实环境测试中,M2Silent系统的字错误率(WER)为6.5%,序列错误率(SER)为12.8%,且音频质量表现优异(PESQ评分为2.81)。
  • 与现有解决方案的优势:
    1. 与基于佩戴设备的方案相比(如耳机或智能眼镜),减少了用户负担和成本。
    2. 与视觉方法相比,解决了隐私问题和环境光照的限制,同时保持高识别率。
    3. 支持多用户的同时交互,这是现有单用户沉默语音系统无法实现的。
  • 实验或评估结果:通过大量实验测试了系统的性能,分析了关键参数对语音质量和识别性能的影响(如信号形状、用户数量、方向和距离)。结果显示系统在多用户场景中表现稳定,交互延迟较低且资源成本适中。
  • 局限性与未来方向:
    1. 支持的最大用户数为三人,更多用户可能导致信号重叠和识别性能下降。
    2. 目前最大有效距离约为2米,远距离应用需要改进音波发射功率或部署更多设备。
    3. 障碍物遮挡会对声音传播和反射信号造成影响,需探索解决方法,如利用环境反射优化设计或分布式多设备系统。
    4. 在健康安全方面,指向性超声波需符合国际标准,未来可优化信号频率以支持更长距离和更高能量。

总结

M2Silent系统通过结合多方向扬声器、FMCW信号和深度学习技术,有效实现了高效、隐私保护的多用户沉默语音交互。这一创新不仅提高了技术实用性,还扩展了语音交互的应用场景,特别适用于车辆、博物馆和公共空间中的交互需求。然而,未来仍需进一步提高系统的用户支持数量、操作距离及复杂环境适应能力,以扩大其应用潜力。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/189260/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714174
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
眼动追踪与注视交互、语音用户界面(VUI)设计、隐私设计与用户控制
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
8 篇相关论文