随身姿态:使用智能手机传感器融合和逆运动学近似用户姿态
全身交互与体感输入人体姿态与行为识别
文献标题
Pose-on-the-Go: Approximating User Pose with Smartphone Sensor Fusion and Inverse Kinematics
文献信息
- 主题领域: 基于智能手机的用户姿态估计和运动捕捉
- 关键词: 身体姿态, 姿态估计, 智能手机, 传感器融合, 逆运动学, 移动应用, 动作捕捉, 人体交互, 增强现实, 虚拟现实
研究背景与问题
-
发现的问题或挑战:
- 当前大多数全身运动捕捉技术需要额外的设备,如穿戴式传感器、多摄像头系统等,这些方案成本较高,同时限制了移动中的使用场景。
- 即便是如 Xbox Kinect 那样的外部设备,也不能在非特定环境(如户外)下便捷使用。
- 缺乏基于智能手机的自包含式解决方案来估计全身姿态。
-
重要性:
- 能够在标准智能手机上实现全身姿态估计有望拓展游戏、社交应用和健康监测等领域的交互体验。
- 智能手机的普及性和所提供的多传感器数据使其成为潜在的具有高可行性的解决方案。
-
研究动机与相关工作:
- 研究者对以前外部传感器和穿戴式追踪技术进行了回顾,包括光学相机、IMU、磁场和超声波等技术。
- 提出 Pose-on-the-Go 系统的目的是利用现有智能手机的硬件(如摄像头、IMU 和深度传感器)来实现自我包含且低成本的移动式姿态捕捉。
解决方案
-
提出的解决方案:
- Pose-on-the-Go 系统通过多传感器融合和逆运动学(IK)技术,实现了基于智能手机的全身姿态估计功能。
- 使用智能手机的前后RGB摄像头、深度摄像头、IMU和触摸屏融合数据,生成用户的实时动画骨架。
-
创新之处:
- 第一个使用单一智能手机实现全身姿态估计的系统,不需要任何额外的硬件或修改。
- 实现了头部、躯干、手臂及腿部的动态姿态估计,虽然是粗略估计,但适用于交互性需求较低的应用场景。
- 提供轻量级的软件实现,理论上可以通过软件更新支持现有智能手机。
-
实施步骤与关键技术:
- 头部位置和朝向: 基于智能手机前置摄像头和 ARKit API 的头部追踪功能。
- 躯干方向估计: 使用深度摄像头捕获头部以下的胸部区域,以计算躯干方向。
- 手臂和手机运动估计: 使用 IMU 和逆运动学生成合理的手臂位姿。
- 腿部与行走动画:结合手机在环境中的绝对位置(6-DOF)和预测的运动模式(如行走或跑步),通过 IK 动画模拟腿部动作。
- 引入了数据同步机制,整合多种传感器的异步数据流,优化实时性。
研究成果
-
具体成果:
- Pose-on-the-Go 能够捕捉全身姿态,并以 25 厘米以下的 3D 空间误差估计用户的关节位置。
- 系统通过实验展示了对动态动作(如抬手、转身和行走)的良好适应性。
-
与现有解决方案相比的优势:
- 与外部传感系统相比,Pose-on-the-Go 更便携、更经济,无需购置额外硬件。
- 与类似的头戴式系统相比,通过智能手机的传感器最大化了普适性和易用性。
-
实验或评估结果:
- 系统在头部方向的平均角误差为 6-10 度;主要关节(如肩膀、肘部)位置误差为 9-27 厘米。
- 绝对空间定位的误差约为 11 厘米。
- 用户测试表明,Pose-on-the-Go 对步态和身体姿态的模拟虽粗略,但足够支持诸如游戏和锻炼等轻度互动场景。
-
局限性与未来方向:
- 主要局限性包括对未直接观测到的身体部位(如持手机手臂之外的手臂、腿部)的状态仅能估计,无法高精度追踪。
- 当前的实现存在延迟(约 350 毫秒),在一些实时交互场景中可能影响用户体验。
- 功耗较高,当前在 iPhone XR 上可持续使用约 2 小时,需进一步优化。
- 未来研究可扩展:
- 用智能手表或额外的传感器优化未持手机手臂的捕捉。
- 提升触摸屏输入的细致性,例如识别手指种类和姿态。
- 引入面部表情、语音动态捕捉,提高社会性互动的表现力。
总结
Pose-on-the-Go 提出了一种创新性的全身姿态估计方法,利用现有智能手机硬件在无额外设备的情况下实现姿态捕捉。这种方法不仅降低了用户门槛,还为移动游戏、健康跟踪、远程社交等多应用场景提供了轻量解决方案,尽管其在精度和实时性方面仍需进一步改进。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3lightbulb
现实痛点
1- 现有的全身运动捕捉需要高成本设备,移动性受限。分类: 人体姿态与骨骼感知同类问题arrow_forward
- 100%
意外的权力姿势对人机交互有多重要?
CHI '18· 全身交互与体感输入 +1
- 100%
关键时间:中风手势生成时间的超精确预测
CHI '18· 全身交互与体感输入 +1
- 100%
手势诱发研究中的一致性分析的不相似性-共识方法
CHI '19· 全身交互与体感输入 +1
- 100%
使用深度强化学习预测空中交互动作和疲劳
CHI '20· 全身交互与体感输入 +1
- 100%
面向日常具身记忆的设计:日记研究启示
DIS '23· 全身交互与体感输入 +1
- 100%
将多视角第一人称视频中的手部检测与识别用于辅助群体活动分析
IUI '19· 全身交互与体感输入 +1
- 67%
通过生物力学模拟进行实时3D目标推断
CHI '24· 全身交互与体感输入 +2
- 67%
MeCap:用于低成本VR/AR头显的全身数字化技术
UIST '19· 全身交互与体感输入 +2
- 67%
OddEyeCam:基于WFoV RGB和NFoV深度摄像头的身体中心透视交互传感技术
UIST '20· 全身交互与体感输入 +2
- 67%
MonoEye: 使用单超广角鱼眼摄像头的多模态人体动作捕捉系统
UIST '20· 全身交互与体感输入 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445582
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
全身交互与体感输入、人体姿态与行为识别
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文