SoundBubble:使用头戴式/眼镜式波束成形的指绑虚拟麦克风
手部手势识别眼动追踪与注视交互声学传感与音频处理UI/UX 设计师AI/ML 研究员与工程师
文献标题
SoundBubble: Finger-Bound Virtual Microphone using Headset/Glasses Beamforming
出版信息
- 主题领域: 人机交互(HCI)与用于XR设备的声学感知。
- 关键词: 声学波束成形、XR头戴设备、虚拟麦克风、手指追踪、振动声学感知、信噪比、被动交互、可穿戴技术、增强现实、机器学习。
背景与问题
- 问题/挑战: 现有的振动声学感知系统通常需要用户佩戴专用配件,如戒指、腕带或手表,这可能不够实用或难以扩展。这些设备还面临电池寿命有限以及难以将手部产生的声音与背景噪声隔离的问题。
- 重要性: 实现无需额外配件的可靠裸手感知技术,可以改善用户体验,减少硬件需求,并扩展XR环境中的交互可能性。
- 动机与相关工作: HCI领域的先前研究探索了使用可穿戴设备的振动声学感知,但这些方法通常存在距离与精度之间的权衡,并需要对手部或物体进行仪器化处理。声学波束成形已被用于声音定位和分离,但基于视觉引导的声学波束成形技术尚未在以手为中心的交互中得到探索。
解决方案
- 提出的方法: SoundBubble——一种基于视觉引导的声学波束成形技术,利用配备麦克风阵列的XR头戴设备或眼镜,在用户的指尖创建虚拟麦克风。
- 创新点:
- 基于视觉引导的声学波束成形技术,可在嘈杂环境中隔离手指产生的声音。
- 实现无需额外配件或仪器化物体的裸手感知。
- 集成空间声压级(SPL)地图和机器学习,实现稳健的交互检测。
- 展示多种应用场景,包括临时触控输入、微手势、被动控件交互和持物活动识别。
- 方法与关键技术:
- 使用XR头戴设备摄像头进行3D手部追踪以引导波束成形。
- 应用延迟求和波束成形技术对多通道麦克风信号进行对齐并抑制背景噪声。
- 生成SPL地图和频谱图作为机器学习模型的输入特征。
- 在多任务和多种噪声条件下评估系统性能。
结果
- 具体发现:
- 总体真阳性率:94.7%;假阳性率:6.8%。
- 临时触控输入:真阳性率97.5%;假阳性率5.5%。
- 被动控件交互:真阳性率97.1%;假阳性率5.1%。
- 持物活动识别:真阳性率89.4%;假阳性率9.9%。
- 背景噪声(比目标声音高达100倍)仅使准确率下降约2.9%。
- 相较基线的优势:
- 单麦克风系统在嘈杂环境中表现出显著较低的准确率和较高的假阳性率。
- 波束成形技术提高了信噪比(SNR),能够检测到细微的手部产生声音。
- 实验/评估:
- 评估了三项任务:临时触控输入(4种表面)、被动控件交互(6种控件)和持物活动识别(8种物体)。
- 在三种噪声条件下进行测试:典型办公室噪声、音乐+咖啡馆噪声和用户说话。
- 消融研究模拟了不同的麦克风阵列几何形状和通道数量,以评估性能权衡。
- 局限性与未来工作:
- 尽管信噪比有所改善,但嘈杂环境仍然具有挑战性。
- 类似眼镜的紧凑型设备可能限制麦克风数量和阵列几何形状,从而影响准确性。
- 功耗和硬件集成需要优化以实现商业化部署。
- 未来工作可探索新应用场景、先进的波束成形技术以及音频增强现实应用。
总结
SoundBubble提出了一种新颖的基于视觉引导的声学波束成形方法,利用XR头戴设备或眼镜实现可靠的裸手振动声学感知。通过在用户指尖创建虚拟麦克风,该系统在多种交互任务中实现了高准确率,即使在嘈杂环境中也表现出色。实验验证了其相较于单麦克风系统的有效性,消融研究突出了麦克风阵列设计的影响。SoundBubble为XR应用开辟了新可能性,包括临时触控输入、微手势和被动物体交互,同时解决了现有可穿戴感知系统的局限性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791589
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
手部手势识别、眼动追踪与注视交互、声学传感与音频处理
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文