HandyTrak:从身体轮廓图像识别 commodity 智能手机的持握之手
手部手势识别眼动追踪与注视交互软件工程师与开发者UI/UX 设计师
文献标题
HandyTrak: Recognizing the Holding Hand on a Commodity Smartphone from Body Silhouette Images
文献信息
- 主题领域: 人机交互、移动计算、计算机视觉
- 关键词: 移动计算, 计算机视觉, 商品智能手机, 深度学习, 手部模式识别, 用户界面, 实时跟踪, 身体轮廓, AI应用
研究背景与问题
-
发现的问题或挑战:
- 用户持握手机的方式直接影响其用户体验,尤其是在一手操作较困难的情况下。随着手机屏幕尺寸的增大,使用手机拇指触达某些屏幕区域变得更加困难。
- 现有方法(如Apple的Reachability功能)需要用户手动启用,或只能在有限情境(如解锁阶段)下识别手部模式,无法实现连续追踪。
- 某些方法还需要额外的硬件设备,这使得其在商品化的智能手机上并不普适。
-
重要性:
- 改善用户体验:通过自动适配UI布局,减小操作难度。
- 提高智能交互的效率,减少用户手动调整UI的需求。
-
研究动机与相关工作:
- 现有研究使用触摸事件、惯性测量单元(IMU)传感器等输入信息来推断手部模式,但需要用户显式交互,或者依赖额外的硬件。
- 本研究的目标是开发一种新方法,借助智能手机的前置摄像头,通过捕捉用户的身体轮廓,实现无用户输入的连续追踪。
解决方案
-
提出的解决方案: HandyTrak是一种基于AI的软件系统,使用商品化智能手机的内置前置摄像头捕捉用户的身体轮廓图像,通过深度学习算法持续识别用户是用左手、右手还是双手持握手机。
-
创新之处:
- 无需额外硬件,仅需智能手机的内置前置摄像头。
- 实现了无需用户显式交互的连续手部模式追踪。
- 提出了使用用户身体轮廓图像进行分类的深度学习方法。
-
实施步骤与技术:
- 图像预处理:
- 对前置摄像头捕获的图像进行尺寸归一化(224×224),通过FCN-ResNet101模型进行人体分割。
- 深度学习:
- 使用经过预训练的VGG16模型设计自定义分类网络(HandyNet)。
- 对分割后的轮廓图像进行左/右/双手的分类,使用softmax层输出结果。
- 系统部署:
- HandyTrak在多种情境下进行训练与测试,模型的参数调整通过实验确定。
- 图像预处理:
研究成果
-
具体成果:
- HandyTrak在用户持手机时实现了平均89.03%的分类准确性(采样率2Hz)。
- 对于倾斜持握手机的情况,分类准确性更高(95.84%,标准差5.05%)。
- HandyTrak的分类准确性在一秒滑动窗口中达到了92.3%,且在不同前置摄像头位置下表现一致。
-
优势:
- 与需要显式输入或额外硬件的现有方法相比,HandyTrak更便捷且普适。
- 在手机应用中可用于动态调整UI布局,如在自拍时适配虚拟按钮位置。
-
实验或评估结果:
- 系统在三种常见情境下(站立、坐着、桌面支撑)表现一致。
- 在倾斜持握手机的情况下,准确性显著提升。
- HandyTrak对不同任务的效果评估显示:解锁时87.56%,应用内浏览时88.37%,自拍时92.68%。
- 续研表明,即使用户在行走状态下使用系统,也能维持88.36%的分类准确性。
-
局限性与未来方向:
- 覆盖范围: 当前仅针对站立、坐着和桌面的三种使用姿势进行训练,未来需扩展到更复杂的使用场景(如躺着、行走等)。
- 用户独立性: 本研究主要采用用户相关的训练模型,用户独立模型的效果较弱,需要更多数据进行大规模训练。
- 能耗与隐私: 持续使用摄像头会增加能耗,未来可通过结合IMU传感器优化系统触发时机。
- 低光适应性: 系统在低光环境下表现有限,未来可结合深度相机解决夜间使用问题。
- 进一步提升: 使用增强的图像分割技术和多模态数据(如深度图像)提升模型性能。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 能否利用普通智能手机的前置摄像头,仅通过身体轮廓图像实时检测用户的持机手模式?分类: 输入识别、触控建模与交互解码方法同类问题arrow_forward
- 深度学习方法如何识别用户是用左手、右手还是双手持机?分类: 输入识别、触控建模与交互解码方法同类问题arrow_forward
- 在不依赖额外硬件的情况下,如何提高手模式识别的准确性和适用性?分类: 输入识别、触控建模与交互解码方法同类问题arrow_forward
lightbulb
现实痛点
1- 大屏手机操作困难,特别是单手触控不便。分类: 输入识别、触控建模与交互解码方法同类问题arrow_forward
- 100%
HandSee:使用前置摄像头立体视觉实现智能手机上的全手交互
CHI '19· 手部手势识别 +1
- 75%
M3手势菜单:触摸屏移动交互标记菜单的设计与实验分析
CHI '18· 手部手势识别
- 75%
PinchList:利用捏合手势在智能手机上进行分层列表导航
CHI '19· 手部手势识别
- 67%
EyeEcho:眼镜上的连续低功耗面部表情追踪
CHI '24· 手部手势识别 +3
- 60%
GestAKey: 个体键帽上的触控交互
CHI '18· 手部手势识别 +1
- 60%
原子触感操作过程中的手指俯仰和滚动方向特征
CHI '18· 手部手势识别 +1
- 60%
VirtualGrasp:利用与实物互动的经验来促进数字对象检索
CHI '18· 手部手势识别 +1
- 60%
投影窗口:将空间中的窗口带到指尖
CHI '18· 手部手势识别 +1
- 60%
精准定位:基于头部和眼睛的增强现实目标选择
CHI '18· 眼动追踪与注视交互 +1
- 60%
从用户与多个设备的交互中训练特定于个人的注视估计器
CHI '18· 眼动追踪与注视交互 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3472749.3474817
一眼看懂
fact_check论文快照
dataset
来源
UIST
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
手部手势识别、眼动追踪与注视交互
work
职业/产业
软件工程师与开发者、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文