TouchPose:从电容图像预测手部姿势、深度估计与触摸分类

手部手势识别人体姿态与行为识别软件工程师与开发者UI/UX 设计师

文献标题

TouchPose: Hand Pose Prediction, Depth Estimation, and Touch Classification from Capacitive Images

文献信息

  • 主题领域: 人机交互、手势识别和触控技术
  • 关键词: 手姿态预测, 深度估计, 电容成像, 多点触控, 人机交互, 手指分类

研究背景与问题

  • 发现问题/挑战: 当前的触摸屏设备仅能检测用户触摸输入的二维坐标,而忽略了手部在三维空间中的复杂构型,导致无法完整地捕捉用户手势。
  • 问题的意义: 高效恢复三维手部骨架可以为触控设备引入更丰富的交互方式,并应用于增强和虚拟现实、康复治疗以及人机交互设计。
  • 研究动机: 现有研究主要利用光学传感器或外部配备的设备(如手套和深度摄像头)恢复手部姿态,缺乏通过日常触摸屏直接进行三维手势预测的解决方案。
  • 相关工作:
    • 传统使用RGB和深度图像进行手部姿态估计。
    • 研究触摸成像技术,但仅限于二维触摸形状或简单手指角度。
    • 手势识别应用中存在数据稀疏性以及触摸与悬浮手指区分的挑战。

解决方案

  • 提出方法: TouchPose,一个深度学习驱动的模型,利用电容图像预测三维手部姿态和深度地图,同时分类触摸事件为指尖或整手触摸。
  • 解决方案创新点:
    • 提出了首个基于电容图像的三维手部骨架预测模型。
    • 多任务学习框架,可同时进行手部姿态预测、深度估计和触摸分类。
    • 通过电容成像直接对手部构型进行推断,无需额外硬件支持。
  • 实现步骤:
    • 数据采集: 构建包含电容图像、对应的三维手部位置标注以及深度地图的65,374对样本数据集。
    • 构建预测模型: 使用U-Net形状的卷积神经网络架构,利用共享嵌入空间进行多任务学习。
    • 模型训练: 使用梯度下降优化器,批量处理并进行多轮训练。
    • 验证与测试: 在交叉用户、交叉手势以及跨回合的方式中验证模型性能。

研究成果

  • 具体成果:
    • 恢复平均端点误差为21.8毫米的三维手部骨架。
    • 平均深度映射误差为22.2毫米。
    • 能够预测触摸区域外的三维关节。
  • 优势:
    • 与现有方法相比,不需要外部传感器或额外设备。
    • 在不同用户、手势以及未见过的样本上均表现出良好的泛化能力。
  • 实验结果:
    • 手指分类准确率最高达91.1%,在交叉手势测试中略降为83.1%。
    • 手指角度预测误差平均为10.4°(偏航角)和9.6°(俯仰角)。
    • 提升触摸板的识别分辨率并提供三维手势数据。
  • 局限性与未来方向:
    • 数据集局限在右手,且不支持多只手同时交互。
    • 对单点触摸的手指分类存在歧义。
    • 需要更高的触摸屏分辨率以及更广的传感范围来提升恢复精度。
    • 推广到更多设备和动态手势场景中需要更多数据记录与训练。
    • 探索生成性方法用于提供多种可能的手部姿态解决方案。

其他分析

  • 应用场景:
    • 提供用户界面设计中基于手势的交互操作。
    • 支持增强现实和虚拟现实的三维控制。
    • 防止误触事件并提升大型屏幕设备上的用户体验。
  • 开放资源: 数据集和模型已公开,支持未来研究者复现和扩展工作。

此文献为触控技术在人机交互场景中的创新应用提供了重要启示,并展示了如何利用稀疏传感器数据进行有效的三维姿态重建。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/61342/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3472749.3474801
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
手部手势识别、人体姿态与行为识别
work
职业/产业
软件工程师与开发者、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文