造型词:一种简单自然的方法,用于增加手势识别训练数据收集的变异性

手部手势识别可视化感知与认知软件工程师与开发者AI/ML 研究员与工程师

文献标题

Styling Words: A Simple and Natural Way to Increase Variability in Training Data Collection for Gesture Recognition

文献信息

  • 主题领域: 人机交互及机器学习,重点于优化手势识别训练数据收集的领域。
  • 关键词: 手势识别, 数据收集, 机器学习, 修饰性词汇, 人体动作变化

研究背景与问题

  • 问题或挑战:

    1. 手势是人机交互中的重要工具,但手势识别模型的精度会受到个人差异、情绪、疲劳以及手势样本的数量和质量的影响。
    2. 数据收集耗时且昂贵,同时受限于控制环境中数据变化的不足。
    3. 训练数据的质量和多样性对于提高机器学习模型的泛化性能至关重要。
  • 重要性: 通过增加训练数据的变化,手势识别模型可以更好地适应实际应用中的复杂情况,提高识别精度。

  • 研究动机与相关工作:

    1. 当前更多关注深度学习模型的优化而非数据质量的提高。
    2. 数据变化通常通过增加参与者数量来实现,但这一方法昂贵且耗费时间。
    3. 数据增强技术已用于图像数据,但对手势视频数据的应用仍存在挑战。

解决方案

  • 提出的方法或解决方案: 作者提出通过在指令中添加修饰性词汇(Styling Words, SWs)引导参与者完成手势操作,显著增加数据的多样性。例如,“执行手势#1快速”会比“执行手势#1”产生更丰富多样的手势表现。

  • 创新之处:

    1. 使用简单而自然的语言指令(修饰性词)以嵌入人为变化。
    2. 提供独特的修饰性词语设计(分为直观词汇和抽象词汇两种)。
    3. 实验验证了数据变化与手势识别精度之间的直接关系。
  • 实施步骤:

    1. 选定 12 种手势并划分为单手或双手动作类型。
    2. 设计两类修饰性词汇:直观词汇(如"慢慢地")、抽象词汇(如"优雅地")。
    3. 通过 OpenPose 识别手势视频中的骨骼关键点。
    4. 使用 DD-Net 模型测试手势识别表现,并比较是否使用 SW 的数据集。

研究成果

  • 具体成果:

    1. 使用 SW 的数据集显示出显著的多样性增加,标准差(std)提高最多达 419%。
    2. 使用高变异性的数据集训练的手势识别模型在准确性上显著优于仅使用传统数据集的模型。
  • 优势对比:

    1. 使用 SW 的模型在测试集上的平均识别准确率提高 9.26%。
    2. 即使训练数据量减少,使用 SW 数据的模型准确率仍保持稳定。
    3. 直观型 SW(如"慢慢地")比抽象型 SW(如"优雅地")表现更佳,增强了模型的鲁棒性。
  • 实验或评估结果:

    1. 在使用了 SW 的数据集进行训练后,手势识别模型对于具有更高变异性的数据表现更佳。
    2. 数据集的分类混淆矩阵显示,某些复杂手势(如"公交车手势")的识别精度有显著提升。
  • 局限性与未来方向:

    1. 某些 SW 会导致手势的过度变化,从而增加噪声,比如"你好手势"可能被误分类。
    2. 修饰性词依赖参与者的主观理解,可能导致表现不一致。
    3. 未来研究可探索更加优化的修饰性词汇,同时尝试将此方法拓展到语音、触摸等其他数据模态。

总结与意义

本文提出了一种基于修饰性词汇的新颖手势数据收集方法,旨在提高数据多样性从而优化机器学习模型的性能。研究表明高质量、高变异的数据集可以减少模型对训练样本量的依赖,并增加手势识别的准确性和泛化性能。修饰性词汇的适用性和潜力在其他互动设计领域值得进一步研究。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/47488/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445457
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
手部手势识别、可视化感知与认知
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文