WheelPose:提高轮椅使用者姿态估计性能的数据合成技术

人体姿态与行为识别外科医生(手术辅助系统)残障服务提供者

文献标题

WheelPose: Data Synthesis Techniques to Improve Pose Estimation Performance on Wheelchair Users

文献信息

  • 主题领域: 数据合成、AI公平性、无障碍系统
  • 关键词: 数据合成, AI公平性, 轮椅用户, 人体姿势估计, 人体动作建模, 无障碍技术, 域随机化, 计算机视觉, Unity引擎, 人体模型

研究背景与问题

  • 作者发现了哪些问题或挑战:

    • 现有的人体姿势估计模型在轮椅用户上的表现较差,主要由于训练数据中缺乏有代表性的轮椅用户数据。
    • 数据采集过程对于残障用户通常缺乏可访问性,包括移动捕捉设备的使用挑战以及不安全姿势的风险。
    • 使用传统的人工标注数据集(如COCO、ImageNet)成本高昂且数据多样性不足,尤其是未充分考虑残障群体。
  • 为什么这个问题很重要:

    • AI模型的公平性和包容性直接依赖训练数据的质量和代表性。残障群体(例如轮椅用户)在许多AI系统的应用中被系统性地忽视。
    • 轮椅用户的姿势估计具有重要价值,例如检测坐姿、预测健康风险(如压力性溃疡)以及分析情绪。
  • 研究动机与相关工作:

    • 作者参考了先前关于合成数据生成和领域随机化的相关工作,发现通过合成数据可以弥补实际数据中的缺失。
    • 受AI公平性和数据获取多样性的推动,作者开发了一个合成数据生成框架以提高轮椅用户相关AI模型的性能。

解决方案

  • 作者提出了哪些方法或解决方案:

    • 提出了一个名为WheelPose的数据合成框架,用于生成基于Unity模拟环境的轮椅用户合成数据。这包括人体动作生成、数据筛选、场景模拟等步骤。
    • 该框架支持通过领域随机化生成具有多样性的数据(如背景、灯光、人类模型的随机化),并输出COCO 17关键点格式的姿势注释。
  • 该解决方案的创新之处:

    • 创建了首个完整标注的轮椅用户数据集,解决了现有数据集缺乏残障群体代表性的问题。
    • 集成了自动化的动作生成和文本描述驱动的动作生成模型(如Text2Motion),提供一种可配置和可拓展的数据模拟环境。
  • 实施步骤与关键技术:

    1. 人体姿势生成: 通过现成的动作捕捉数据(HumanML3D)和文本驱动动作生成模型(Text2Motion),生成轮椅用户的动画关键帧。
    2. 人体模型和场景配置: 使用Unity SyntheticHumans提供丰富的人体模型,其外观、衣着等可随机化配置。
    3. 模拟环境生成: 使用Unity Perception实现领域随机化,例如随机背景图像、灯光参数和摄像机位置。
    4. 输出合成数据: 通过COCO 17关键点姿势注释格式生成最终的合成图像数据集。

研究成果

  • 取得了哪些具体成果:

    • 构建了一个新的合成数据集,包含70,000张轮椅用户图像,每张图像带有完整的姿势注释。
    • 合成数据显著提高了基于ImageNet训练的Detectron2模型在轮椅用户上的检测与关键点估计性能。
  • 与现有解决方案相比的优势:

    • 提高了模型的公平性和包容性,尤其在轮椅用户身体自遮挡场景的关键点预测中表现突出。
    • 生成的数据具有更高的多样性和真实性,可广泛用于盲区检测、障碍物分析等实际应用。
  • 实验或评估结果:

    • 模型在测试数据集上,相较于ImageNet基线模型,Bounding Box检测mAP提高了98%,关键点预测mAP提升了7.81%。
    • 人体评估测试显示合成运动序列的现实感较高,特别是去除人类认为“不真实”的动作后,模型性能进一步改善。
  • 局限性与未来方向:

    • 局限性:

      • 数据集并未充分涵盖所有类型的轮椅用户(如截肢者、侏儒症患者等),未来需扩展更多样化的身体模型。
      • 人类评估的样本量较小(13名轮椅用户),代表性有限。
    • 未来方向:

      • 增加对于其他残障群体(如拐杖用户、假肢用户)的建模和数据合成支持。
      • 结合最新3D环境生成技术(如NeRF)以提高场景真实性。
      • 开发更复杂的动作生成模型以捕捉更自然的轮椅用户行为。

通过该研究,作者为合成数据生成在无障碍技术中的应用做出了重要贡献,并提供了一个开放的工具平台供研究社区使用(代码库链接:https://github.com/hilab-open-source/wheelpose)。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/148072/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642555
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
人体姿态与行为识别
work
职业/产业
外科医生(手术辅助系统)、残障服务提供者
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文