MAF:探索移动声场在手部到面部手势交互中的应用

触觉可穿戴设备手部手势识别

文献标题

MAF: Exploring Mobile Acoustic Field for Hand-to-Face Gesture Interactions

文献信息

  • 主题领域: 人机交互、手势识别、声学感知
  • 关键词: 可穿戴计算, 手势检测, 声学感知, 表面声波, 骨传导耳机, 深度学习, 用户体验

研究背景与问题

  • 问题与挑战:
    • 当前的手势检测系统主要依赖惯性测量单元(IMU)、电容传感器或摄像头等,而这些方法对非接触式手势检测的能力有限。
    • 摄像头的解决方案易受到光线条件、不隐私性以及遮挡问题的影响;雷达技术成本高,功耗大;其他方法如振动传感器或声音信号需专用硬件支持。
  • 研究重要性:
    • 开发一种能通过常规的、易获取的骨传导耳机检测面部手势的技术,将极大推动基于手势的人机交互的日常应用,并与扩展现实(XR)技术集成。
  • 研究动机:
    • 假设通过声学方式检测手势,无需专用硬件,即可实现手势检测,同时能检测接触式和非接触式手势。
    • 骨传导耳机能够生成表面声波(SAW)和泄漏表面声波(LSAW),两者合成了移动声学场(MAF),可为手势检测提供新机遇。

解决方案

  • 方法与技术:
    • 提出基于骨传导耳机的“移动声学场” (Mobile Acoustic Field, MAF),生成表面声波与泄漏声波,通过检测声波因手势造成的波形干扰,识别手势动作。
    • 设计一个信号处理流程,包括滤波、信号增强、基于KL散度的分割以及手势分类。
    • 使用卷积递归神经网络(CRNN)进行声学信号特征学习与分类。
  • 实施步骤:
    1. 信号生成: 用骨传导耳机在超声波频段发射探测信号,生成稳定声学波。
    2. 信号预处理: 使用滤波器去噪并用维纳滤波提升信号质量。
    3. 信号分割: 基于信号波形的KL散度检测手势间隔并分割。
    4. 分类与识别: 使用结合CNN和LSTM的深度学习模型识别手势类型。

研究成果

  • 具体成果:
    • 成功设计出MAF系统的信号处理管线,并识别了10种手势,覆盖接触式如"单次面部按压"和非接触式如"手掌靠近面部" 等。
    • 系统在22名用户的实验中,平均手势识别准确率高达92%。
  • 实验与评估结果:
    • 在不同音量、距离、动作状态(静止、行走、跑步)下均成功检测手势。
    • 比较了不同机器学习模型(SVM、kNN、决策树、CNN等)性能,发现CRNN的精确度显著高于传统模型。
    • 显示用户在早晨(皮肤湿润)与晚上(皮肤油腻)条件下的识别性能变化不显著。
    • 噪音环境、耳机佩戴位置再次调整、音乐播放等变量对识别精度影响小。
  • 优势与创新:
    • 使用便携式耳机,无需专用传感器,成本低且易于部署。
    • 支持复杂的日常环境下的手势检测(如行走、说话)。
    • 在语音或音乐播放的同时进行手势检测,二者互不干扰。
  • 局限性与未来方向:
    • 目前仅支持骨传导耳机,需进一步研究更多通用设备支持。
    • 用户需要将麦克风贴在头部,不便于日常使用,但未来可探索耳机内置麦克风直接使用。
    • 当前模型对复杂小手势(如双指拖动或捏耳朵)识别性能较差,可以通过增加模型容量解决,但需要权衡处理延迟。
    • 未来或许可以探索更高级的算法以应对运动干扰(如行走或跑步时的识别影响)。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/147716/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642437
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
触觉可穿戴设备、手部手势识别
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文