M^2Silent: 通过共享空间中的多方向扬声器实现多用户无声语音交互
作者
眼动追踪与注视交互语音用户界面(VUI)设计隐私设计与用户控制
研究背景与问题
- 发现的问题或挑战:作者发现当前的语音交互系统在多用户共享空间中存在隐私保护不足、噪声干扰严重以及不支持沉默语音交互的问题。在博物馆、车辆和办公室等场景中,用户不愿大声说话或存在隐私需求,这限制了语音控制系统的应用。此外,现有的沉默语音接口通常需要附加设备,如摄像头、毫米波雷达或穿戴设备,存在不便与高成本问题。
- 重要性:随着语音控制设备的普及,隐私问题逐渐凸显。解决这一问题不仅可以扩展语音交互的应用场景,还能提高用户体验和社会接受度。
- 研究动机与相关工作:尽管领域研究已经探索了多个方法(如基于电肌图、摄像检测或毫米波雷达的沉默语音识别),但这些方法通常仅限单用户设置,或是对隐私和便捷性的要求未得到满足。作者试图开发一种在共享环境中同时支持多用户交互且无需佩戴设备的解决方案。
解决方案
- 提出的方案:作者提出了M2Silent系统,该系统结合了多方向扬声器、频率调制连续波(FMCW)信号和深度学习技术,实现了多用户同时沉默语音交互。其特点是整合了音频传输和沉默语音感知功能。
- 创新之处:
- 首次将多方向扬声器与沉默语音交互相结合,支持多用户同时进行设备无接触的交互。
- 用FMCW信号作为音频载波来同时进行语音播放与用户环绕感知。
- 提出时间偏移FMCW信号和盲信号分离算法以分解多用户的沉默语音特征。
- 使用滑动窗口和深度残差模型SilentMatch实现实时和句子级的沉默语音识别。
- 实施步骤:
- 调制音频为FMCW信号,并通过空气非线性进行解调以实现清晰的音频播放。
- 通过时间偏移将信号分配到不同方向以区分用户特征,并应用盲信号分离技术隔离用户特征。
- 使用SilentMatch深度学习模型进行词级别和句子级语音识别。
- 在实时交互中采用滑动窗口方法处理单词串,确保流畅的交互。
研究成果
- 具体成果:
- 实现了设备无接触式的多用户同时沉默语音交互。
- 在真实环境测试中,M2Silent系统的字错误率(WER)为6.5%,序列错误率(SER)为12.8%,且音频质量表现优异(PESQ评分为2.81)。
- 与现有解决方案的优势:
- 与基于佩戴设备的方案相比(如耳机或智能眼镜),减少了用户负担和成本。
- 与视觉方法相比,解决了隐私问题和环境光照的限制,同时保持高识别率。
- 支持多用户的同时交互,这是现有单用户沉默语音系统无法实现的。
- 实验或评估结果:通过大量实验测试了系统的性能,分析了关键参数对语音质量和识别性能的影响(如信号形状、用户数量、方向和距离)。结果显示系统在多用户场景中表现稳定,交互延迟较低且资源成本适中。
- 局限性与未来方向:
- 支持的最大用户数为三人,更多用户可能导致信号重叠和识别性能下降。
- 目前最大有效距离约为2米,远距离应用需要改进音波发射功率或部署更多设备。
- 障碍物遮挡会对声音传播和反射信号造成影响,需探索解决方法,如利用环境反射优化设计或分布式多设备系统。
- 在健康安全方面,指向性超声波需符合国际标准,未来可优化信号频率以支持更长距离和更高能量。
总结
M2Silent系统通过结合多方向扬声器、FMCW信号和深度学习技术,有效实现了高效、隐私保护的多用户沉默语音交互。这一创新不仅提高了技术实用性,还扩展了语音交互的应用场景,特别适用于车辆、博物馆和公共空间中的交互需求。然而,未来仍需进一步提高系统的用户支持数量、操作距离及复杂环境适应能力,以扩大其应用潜力。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何通过隐形语音交互(silent voice interaction)保护隐私并减少噪声干扰?分类: 无声语音、耳语与唇动交互同类问题arrow_forward
- 多用户共享空间中,如何实现无需设备支持的高效隐形语音识别?分类: 无声语音、耳语与唇动交互同类问题arrow_forward
- 如何集成多向扬声器与深度学习以提升隐形语音交互的准确性和实用性?分类: 无声语音、耳语与唇动交互同类问题arrow_forward
lightbulb
现实痛点
1- 共享空间中,用户因隐私顾虑不愿大声说话,限制语音控制使用。分类: 无声语音、耳语与唇动交互同类问题arrow_forward
- 67%
使用非语言声音提供方向刺激的雷达隐喻评估
CHI '19· 眼动追踪与注视交互 +1
- 67%
TAGSwipe:触控辅助 gaze swipe 文本输入
CHI '20· 眼动追踪与注视交互 +1
- 67%
哈默:通过凝视和哼唱进行文本输入
CHI '21· 眼动追踪与注视交互 +1
- 67%
整合视线和语音以实现隐式交互
CHI '22· 眼动追踪与注视交互 +1
- 67%
调查视频通话面试中模拟眼神交流的影响
CHI '25· 眼动追踪与注视交互 +1
- 67%
EyeSayCorrect:基于眼球追踪和语音的移动设备无接触文本修正方法
IUI '22· 眼动追踪与注视交互 +1
- 67%
PrivateGaze:保护黑盒移动眼球追踪服务中的用户隐私
UbiComp '24· 眼动追踪与注视交互 +1
- 60%
PrivateTalk:使用蓝牙耳机通过手掩嘴手势激活语音输入
UIST '19· 眼动追踪与注视交互 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714174
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
眼动追踪与注视交互、语音用户界面(VUI)设计、隐私设计与用户控制
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
8 篇相关论文