C4.04.1Static pose versus dynamic gesture设计研究

静态姿态靠形状识别,动态手势靠轨迹识别

别名: 静态手形 · hand pose · trajectory recognition · 动态手势

概念解释

静态姿态(static pose / hand pose)在某一帧上认形状:伸掌、握拳、比“V”,时间维几乎不进模型。动态手势(dynamic gesture)认的是一段轨迹:位置、朝向、速度如何随时间变化。两者都能当空中命令,但失败模式不同。姿态错在手指被遮挡或手形与模板差得远;轨迹错在速度、幅度和切分。把“张开手”和“向右挥”写成同一种“手势”,会让识别器、教学和评测共用一套不该共用的假设。

机制

姿态识别吃的是单帧骨架或深度图上的关节角、指尖相对位置,分类器可以是每帧独立的。它不需要起止切分,却需要那一帧的手形是完整可见的。轨迹识别吃的是时间序列,隐马尔可夫、动态时间规整或时序网络都在对齐一条路径。它对单帧手形的完整性要求较低(挥手时手指可以模糊),但对时间对齐敏感:同样的空间路径,快一倍或慢一倍,距离会涨。姿态可以当动态手势的关键帧约束,但关键帧不是轨迹;只用三张手形图去教一条挥手,学习者会停在那三张上,而识别器要的是中间那些帧的运动。

怎么研究

把词表拆成“只需形状”和“必须走路径”两组,分别报混淆矩阵,不要混成一个识别率。姿态组的自变量是视角、遮挡、手与相机的距离;动态组的自变量是速度、幅度、切分策略。交叉条件很有诊断价值:让人用正确手形但不移动,看动态识别器是否仍触发;让人按轨迹移动但手形全程错误,看姿态门控是否拦住。数据集若把静态照片和视频片段标成同一套标签,后续论文会无法解释错误来自哪一类模型。

边界

有些命令是混合的:先摆出一个姿态再划出去(捏住再拖)。混合项必须拆开写,哪一段靠形状、哪一段靠轨迹,否则调试时不知道该补关键点还是补时间对齐。手语里的手指语偏静态、词级手语偏动态,搬到界面词表时不能假设同一套传感器参数。仅用手部 RGB、没有深度时,静态姿态在侧视和背视下会坍缩成相似剪影;动态轨迹在垂直于相机的平面上投影也会变扁。头戴设备看自己的手,视角相对稳定,姿态更便宜;房间相机看过路的人,轨迹更稳、姿态更脆。

怎么落地

  • 词表里每一条先标类型:姿态、轨迹,还是姿态加轨迹。教学、识别器和测试集按类型分开,不要共用一个“手势准确率”。
  • 姿态条目检查多视角和遮挡;轨迹条目检查快慢和切分。两类错误不要互相拿去补数据。
  • 混合命令写成状态机:进入某手形、保持或移动、离开,而不是丢进一个端到端标签。

延伸

  • 同组C4.04.2 静态姿态需要保持,产生持续肌肉负担 · C4.04.3 动态手势的速度与幅度个体差异更大
  • 相邻C4.03 手势的起止判定 · C4.09 手指数量作为输入
  • 站内检索static hand pose · dynamic gesture · trajectory recognition

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/C4.04.1