RIDS:虚拟现实中自由手势指点时利用手部运动动力学对选择手势的隐式检测

手部手势识别人体姿态与行为识别

文献标题

RIDS: Implicit Detection of a Selection Gesture Using Hand Motion Dynamics During Freehand Pointing in Virtual Reality

文献信息

  • 主题领域: 虚拟现实中的手势识别与人机交互
  • 关键词: 选择手势检测, 手部运动动力学, 手势识别, 虚拟现实, 时间卷积网络, 自然交互, 输入预测

研究背景与问题

  • 发现的问题或挑战:

    1. 当前的虚拟现实和增强现实中的自由手势交互虽然直观,但缺乏可靠性和鲁棒性。
    2. 现有手势识别方法受限于遮挡、传感器噪声等问题,导致误识别(假阳性和假阴性)。
    3. 当前方法(如激活手势)要求用户额外的操作,增加了交互负担。
  • 研究的重要性:

    1. 改进虚拟环境中交互的准确性,可以显著提升用户体验。
    2. 通过利用用户的隐式行为(如手部运动动力学),可以为当前的手势检测模型补充额外信号,从而提升检测效果。
  • 研究动机与相关工作:

    1. 之前的研究聚焦于基于眼动行为的隐式选择检测,但眼动技术在许多消费级设备中尚未普及,且受光照、眼镜影响。
    2. 本研究探讨通过手部运动动力学改进手势选择检测的可能性,这在虚拟现实中的自由手势交互场景中具有较高的潜力。

解决方案

  • 方法或解决方案: 作者提出了一种名为 "Real-time Implicit Detection of Selections" (RIDS) 模型。该模型利用用户在进行自由手势指向操作时的手部运动历史数据来预测选择手势行为,解决手势检测中的误差问题。

  • 创新之处:

    1. 利用历史手部运动动力学数据作为输入,独立于具体的手势传感与目标定位。
    2. 提出两种模型:基于特征的逻辑回归模型和基于原始时间序列数据的时间卷积网络 (Temporal Convolutional Network, TCN)。
    3. 模型验证不仅基于当前任务,还探索其在其他任务中的通用性。
  • 实施步骤与关键技术:

    1. 数据采集: 设计一个 VR 骰子游戏,采集手部运动 6自由度数据,检测捏合手势(如指尖捏合)。
    2. 模型开发:
      • 逻辑回归模型通过手部特征提取(如速度、加速度、绝对功率)进行隐式选择行为检测。
      • TCN 模型直接从原始手部时间序列数据中提取信息。
    3. 模型评价: 使用交叉验证和 Leave-One-Subject-Out Cross-Validation (LOSOCV) 方法评估模型性能,主要通过 PR-AUC 和精度-召回指标检测。
    4. 通用性测试: 用训练模型在其他任务(例如基于控制器的目标选择任务)中测试其性能,以验证模型的普适性。
    5. 改进应用: 将 RIDS 输出与现有的 IMU 配合的捏合手势检测模型融合,实现更高的准确性。

研究成果

  • 具体成果:

    1. 逻辑回归模型:
      • 依赖手势特征,最高 PR-AUC 达到 0.37。
      • 在 Leave-One-Subject-Out 交叉验证中,平均 PR-AUC 为 0.36,比随机水平高出 184%。
    2. TCN 模型:
      • 在最佳滑动窗口(1333.33 毫秒)下,训练数据 PR-AUC 达到 0.93,比随机水平高 644%。
      • 在 LOSOCV 测试中,平均 PR-AUC 达到 0.90,比随机水平高出 617%。
    3. 通用性:
      • 训练 Dice Game 模型后,在新的任务(基于控制器的目标选择)中 PR-AUC 为 0.47,比基线高出 276%。
    4. 融合应用效果:
      • 将 TCN RIDS 模型与 IMU 驱动捏合检测结合后,显著提高了检测精度(从 0.62 提高到 0.69),同时保证召回率(从 0.79 提高到 0.80)。
  • 相较现有解决方案的优势:

    1. 提高了虚拟现实中手势检测的精确性,尤其是在噪声较大的场景中。
    2. 模型不仅能够检测当前的手势,还具有一定的任务泛化能力,可应用于其他交互场景。
  • 局限性与未来方向:

    1. 实验设计局限性: 当前设备和任务场景可能限制模型在其他硬件或更加复杂场景下的性能。
    2. 噪声问题: 模型对不同硬件或感应精度的依赖需要进一步研究。
    3. 应用探索:
      • 可用于其他涉及手势的交互,如滑动、键入等。
      • 进一步集成预测功能,提前检测用户意图。
    4. 优化方向: 探讨更高效的融合方法(早期数据融合)、任务无关的模型训练以及实时部署中的模型调整。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/85054/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3526113.3545701
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
手部手势识别、人体姿态与行为识别
work
职业/产业
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文