静态姿态靠形状识别,动态手势靠轨迹识别
别名: 静态手形 · hand pose · trajectory recognition · 动态手势
概念解释
静态姿态(static pose / hand pose)在某一帧上认形状:伸掌、握拳、比“V”,时间维几乎不进模型。动态手势(dynamic gesture)认的是一段轨迹:位置、朝向、速度如何随时间变化。两者都能当空中命令,但失败模式不同。姿态错在手指被遮挡或手形与模板差得远;轨迹错在速度、幅度和切分。把“张开手”和“向右挥”写成同一种“手势”,会让识别器、教学和评测共用一套不该共用的假设。
机制
姿态识别吃的是单帧骨架或深度图上的关节角、指尖相对位置,分类器可以是每帧独立的。它不需要起止切分,却需要那一帧的手形是完整可见的。轨迹识别吃的是时间序列,隐马尔可夫、动态时间规整或时序网络都在对齐一条路径。它对单帧手形的完整性要求较低(挥手时手指可以模糊),但对时间对齐敏感:同样的空间路径,快一倍或慢一倍,距离会涨。姿态可以当动态手势的关键帧约束,但关键帧不是轨迹;只用三张手形图去教一条挥手,学习者会停在那三张上,而识别器要的是中间那些帧的运动。
怎么研究
把词表拆成“只需形状”和“必须走路径”两组,分别报混淆矩阵,不要混成一个识别率。姿态组的自变量是视角、遮挡、手与相机的距离;动态组的自变量是速度、幅度、切分策略。交叉条件很有诊断价值:让人用正确手形但不移动,看动态识别器是否仍触发;让人按轨迹移动但手形全程错误,看姿态门控是否拦住。数据集若把静态照片和视频片段标成同一套标签,后续论文会无法解释错误来自哪一类模型。
边界
有些命令是混合的:先摆出一个姿态再划出去(捏住再拖)。混合项必须拆开写,哪一段靠形状、哪一段靠轨迹,否则调试时不知道该补关键点还是补时间对齐。手语里的手指语偏静态、词级手语偏动态,搬到界面词表时不能假设同一套传感器参数。仅用手部 RGB、没有深度时,静态姿态在侧视和背视下会坍缩成相似剪影;动态轨迹在垂直于相机的平面上投影也会变扁。头戴设备看自己的手,视角相对稳定,姿态更便宜;房间相机看过路的人,轨迹更稳、姿态更脆。
怎么落地
- 词表里每一条先标类型:姿态、轨迹,还是姿态加轨迹。教学、识别器和测试集按类型分开,不要共用一个“手势准确率”。
- 姿态条目检查多视角和遮挡;轨迹条目检查快慢和切分。两类错误不要互相拿去补数据。
- 混合命令写成状态机:进入某手形、保持或移动、离开,而不是丢进一个端到端标签。