通过跟踪3D手势轨迹识别盲用户的手势
作者
手部手势识别视觉障碍者技术(屏幕阅读器、触觉图形、盲文)残障服务提供者辅助技术专家
文献标题
Hand Gesture Recognition for Blind Users by Tracking 3D Gesture Trajectory
文献信息
- 主题领域: 手势识别、可穿戴设备、人机交互、无障碍设计
- 关键词: 手势识别, 盲人用户, 3D轨迹, 智能手表, 无障碍设计, 深度学习, 机器学习, 动态时间规整, 多视角CNN, 无传感器数据训练
研究背景与问题
-
发现的问题与挑战:
- 盲人的手势性能与视障用户显著不同,这导致现有手势识别算法在盲人群体中的表现不佳。
- 盲人的手势具有高用户间变化性、更高的加速度噪声(如抖动和急动)、以及更低的手势速度。
- 收集大规模盲人用户的训练数据困难,现有通过转移学习等方式训练的手势识别算法无法有效适应盲人用户。
-
重要性:
- 为视障用户开发替代互动方式以提高其对智能设备(如智能手表)的使用便利性,有助于提高技术无障碍性。
- 理解盲人用户在执行手势时的行为差异对设计新型无障碍技术至关重要。
-
研究动机与相关工作:
- 现有手势识别算法主要以视力正常用户为目标群体,无法很好地泛化到盲人用户(例如基于大规模训练数据的TapNet和依赖模板匹配的AccessWear)。
- 最前沿算法面临数据需求与盲人手势特性不一致的问题,迫切需要提出新方法解决这一差距。
解决方案
方法与解决方案
- 提出了一种基于3D手势轨迹的新算法,此算法仅依赖陀螺仪数据(放弃嘈杂的加速度计数据)。
- 提出了对盲人手势识别的关键洞察——手势中存在用户无关的微动(nucleus),新方法通过学习这些微动来提高泛化性。
- 开发了一个多视角卷积神经网络(Multi-view CNN)和基于几何特性的一维卷积神经网络(Geometric-property based 1D CNN),融合两者构建了一个新颖的组合分类器。
创新之处
- 强调关注手势中的用户不变微动部分(即手势的nucleus),从而减少对大规模用户样本的依赖。
- 将手势识别问题转化为3D轨迹空间的分类问题,对复杂手势的性能显著提升。
- 提出了多视角CNN模型结合几何特性分类器的架构,使得算法对盲人用户执行的动作更鲁棒。
实施步骤与关键技术
- 用户研究:招募10名盲人和16名视障用户,量化盲人手势的噪声、速度、抖动等特性,以指导算法设计。
- 轨迹处理:通过信号处理算法(如能量变化点检测)估算手势轨迹的微动部分。
- 分类器训练:
- 多视角CNN:将微动的3D轨迹转化为多角度图像进行学习。
- 几何特性模型:提取轨迹的曲率、扭率、重心距离函数(CDF)等特征用于识别。
- 算法融合:两个模型的结果通过组合分类器整合,优化最终决策。
研究成果
具体成果
- 提出的手势识别算法通过实验验证在盲人用户群体手势分类中达到了92%的准确率,显著优于下一最佳算法(82%)。
与现有解决方案比较的优势
- 对噪声免疫: 凭借对3D轨迹和微动核的精确学习,有效降低加速度计噪声的影响。
- 数据效率高: 算法仅需少量盲人用户数据即可表现优异,避免了大规模采集训练样本的需求。
- 能处理复杂手势: 能有效识别复合型和复杂形状手势,与基于2D模板匹配的系统(如AccessWear)相比表现显著提升。
实验和评估结果
- 系统在15种手势上的均值准确率达到92%(精确率:92%,召回率:91%)。
- 留一法(Leave-One-Out)交叉验证显示模型能有效泛化,训练3个用户样本后准确率达到90%。
- 与四种现有技术(TapNet, Serendipity, Few-shot learning, AccessWear)对比,性能全面领先:
| 方法 | 准确率 | 精确率 | 召回率 |
|---|---|---|---|
| 本文算法 | 92% | 92% | 91% |
| TapNet | 77% | 77% | 77% |
| Serendipity | 82% | 82% | 82% |
| Few-shot (Xu) | 45% | 45% | 47% |
| AccessWear | 68% | 65% | 68% |
局限性与未来方向
- 样本规模局限:
- 当前研究基于10名盲人用户,未来需更大规模研究以提升普适性。
- 对用户不断学习的需求:
- 虽然仅需少量样本即可微调模型(3个样本即可表现优异),但使用完全零样本泛化的算法仍有改进空间。
- 跨用户组的扩展性:
- 本研究侧重盲人用户,而算法在普通用户和其他特定群体中的效果尚未完全评估。
整体来看,本研究不仅解决了手势识别在盲人应用场景中的关键问题,还对如何让算法更好地泛化且减少数据需求提供了重要思路。这对AI无障碍技术的进一步发展具有重要参考价值。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 当前手势识别算法对盲人用户适配性不足的原因是什么?分类: 盲人与低视力无障碍同类问题arrow_forward
- 如何构建基于3D手势轨迹的算法,提高盲人用户手势识别的精度?分类: 盲人与低视力无障碍同类问题arrow_forward
- 用户独立的微运动组件(nucleus)如何应用于盲人手势识别中?分类: 盲人与低视力无障碍同类问题arrow_forward
lightbulb
现实痛点
1- 盲人很难通过手势自然地与智能手表等智能设备交互。分类: 盲人与低视力无障碍同类问题arrow_forward
- 75%
面向视障人士的面部识别应用程序:超越实验室的理解使用
CHI '18· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 75%
使视障人士能够使用触觉和听觉手杖模拟导航虚拟现实
CHI '18· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 75%
转向轮:一种用于低视力网络浏览的保局放大界面
CHI '18· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 75%
Caption Crawler:利用反向图像搜索实现可重复使用的替代文本描述
CHI '18· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 75%
探索技术在提升视力丧失者生活质量方面的机遇
CHI '19· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 75%
LightWrite:使用智能手机教授盲人手写
CHI '21· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 75%
触觉凝视:视障人士探索凸起线条图形的行为标志
CHI '21· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 75%
使用自然声音的可访问数据表示
CHI '23· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 75%
ImageAssist: 增强盲人和低视力用户基于触摸屏的图像探索系统的工具
CHI '23· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 75%
解释什么是树状图:探索性调查向盲人和低视力用户解释不熟悉的图表的策略
CHI '23· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642602
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
手部手势识别、视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
work
职业/产业
残障服务提供者、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文