分类头部运动以区分头部注视和头部手势作为不同的输入模式
作者
眼动追踪与注视交互人体姿态与行为识别
文献标题
Classifying Head Movements to Separate Head-Gaze and Head Gestures as Distinct Modes of Input
文献信息
- 主题领域: 人机交互、机器学习、虚拟现实交互
- 关键词: Head Gestures, Eye Tracking, Virtual Reality, Eye-head Coordination, Computational Interaction, Machine Learning, XGBoost
研究背景与问题
-
发现的问题或挑战:
- 头部移动常被看作一种单一类型的输入,但实际上存在两种本质不同的类型:Head-Gaze(伴随眼动的头部运动)和 Head Gestures(独立于眼动的头部手势)。
- 当前的头部跟踪界面没有区分这两种输入模式,导致它们互相干扰,例如因 Head-Gaze 产生的误触发或因 Head Gestures 的遗漏而影响交互的流畅性。
- 已有的基于阈值的分类方法准确性不足,无法有效分离这两类运动。
-
重要性:
- 区分 Head-Gaze 和 Head Gestures 能够发挥每种移动模式的优势,为人机交互设计带来更精准、更自然的用户体验。
- 在虚拟现实(VR)/增强现实(AR)等场景中,头部输入越来越多地被用于无触控的交互方式,但其分类与筛选机制仍有待改进。
-
研究动机与相关工作:
- 灵感来源于 Sidenmark 等人的 BimodalGaze 方法,该方法尝试通过基于阈值的规则分离 Head-Gaze 和 Head Gestures,但效果有限。
- 机器学习方法在头部运动行为建模等领域已有初步尝试,但尚未针对区分 Head-Gaze 和 Head Gestures 提出具体解决方案。
解决方案
-
提出的方法或解决方案:
- 开发了一种名为 HeadBoost 的机器学习分类器,基于大量训练数据自动区分 Head-Gaze 和 Head Gestures。
- 使用 XGBoost 算法,结合诸多特征(如形态、噪声、时序和相关性特征),显著提升分类准确性。
-
创新点:
- 提出了清晰区分 gaze-driven 和 gaze-independent 头部移动的概念并实现分类。
- 与以往基于简单阈值的分类器不同,HeadBoost 通过机器学习模型捕获更复杂的运动模式与特征。
- 设计了独特的实验任务和数据采集方法以自动标注分类数据,避免主观人工标注引入的人为误差。
-
实施步骤与技术:
-
数据采集:
- 在虚拟现实环境中设计任务,参与者完成眼球注视(Head-Gaze)和头部手势(Head Gestures)的交替任务。
- 记录头部位置、眼球方向等数据并自动标注为 Head-Gaze 或 Head Gestures。
- 收集了来自 18 名参与者的超过 119 万条带时间戳的数据样本。
-
特征提取:
- 提取 5 大类特征,包括形态特征(如速度、加速度等)、噪声特征(如标准差、分散度等)、时序特征(如从最后一次扫视的时间)、频谱特征和相关性特征。
- 采用相关性筛选等方法从多个特征中挑选出 81 个最相关的特征。
-
模型开发与训练:
- 选用 XGBoost 模型进行训练,采用用户独立(user-independent)和用户相关(user-dependent)方法分别验证分类器的性能。
- 不同的时间窗口和采样率也被测试以优化模型表现。
-
研究成果
-
具体成果:
- HeadBoost 在用户独立的测试中实现了较高的分类性能:?1-Score 达到 0.89,显著高于基线方法(?1-Score:0.62)。
- 分类器还解决了基线方法无法检测低速头部手势的问题,并能提前 119ms 检测到手势的开始。
-
与现有方法相比的优势:
- 明显提高了分类性能。
- 能有效区分速度较慢或较精细的头部手势,而不依赖固定的阈值。
- 建立了基于机器学习的通用模型,适应不同用户的个体差异。
-
实验或评估结果:
- 用户独立模型的 ?1-Score 和 AUC 等指标均高于用户相关模型,证明了该方法可用于通用场景。
- 实验中提炼了头部运动的适用范围:最小可控旋转角度约为 0.3°,最大舒适角度约为 40°。
-
局限性与未来方向:
- 实验范围有限:
- 当前实验要求参与者保持静坐,仅允许头部旋转,未来需扩展至包括躯干运动和动态环境的情况。
- 设备限制:
- 数据采集主要依赖 VR 头显,其结果可能因为低精度设备在真实场景中的表现而受到影响。
- 实时性限制:
- 当前分类器运行速率为 30Hz,未来研究可通过降维优化模型提高响应速度。
- 应用评价不足:
- 虽已提出三种示例应用,但尚未通过用户实验对它们进行广泛验证。
- 意图识别问题:
- 分类器无法直接判断头部运动是否具有交互意图,未来需结合更复杂的行为理解技术优化。
- 实验范围有限:
总结
本文通过设计高效的机器学习分类器 HeadBoost,成功区分 Head-Gaze 和 Head Gestures,为头部驱动的人机交互提供了新的可能性与实践路径。HeadBoost 的创新使交互设计能够在提高精确度的同时,提供更自然的体验并避免误触发,适用于 AR/VR 等新兴应用领域。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何区分伴随眼动的头部注视(Head-Gaze)和独立的头部手势(Head Gestures)?分类: 社交、服务与护理机器人交互设计同类问题arrow_forward
- 机器学习(如XGBoost)是否能比阈值法更准确地分类头部注视和头部手势?分类: XR眼动追踪与凝视交互同类问题arrow_forward
- 如何设计高效的数据采集和特征提取方法以支持头部运动分类?分类: XR眼动追踪与凝视交互同类问题arrow_forward
lightbulb
现实痛点
1- VR和AR中的头部输入因误分类导致交互不自然或错误触发。分类: XR眼动追踪与凝视交互同类问题arrow_forward
- 100%
基于注视的选择的自适应模型
CHI '21· 眼动追踪与注视交互 +1
- 100%
会聚匹配:在3D环境中通过注视辅助选择推断对物体的注意力
CHI '23· 眼动追踪与注视交互 +1
- 100%
比较凝视时间、追踪和凝视手势在手持移动设备上的凝视交互
CHI '23· 眼动追踪与注视交互 +1
- 100%
看着但不集中:定义基于注视的注意力偏差指标及分类注意力状态
CHI '25· 眼动追踪与注视交互 +1
- 100%
通过非言语行为检测小型自然群体中的低融洽度
IUI '18· 眼动追踪与注视交互 +1
- 100%
SUPREYES:基于隐式神经表示学习的眼睛超分辨率方法
UIST '23· 眼动追踪与注视交互 +1
- 67%
你的眼睛说明了一切:利用平滑追踪评估认知工作负荷
CHI '18· 眼动追踪与注视交互 +2
- 67%
专注的面孔:一项关于注意力状态的面部线索的研究
CHI '20· 眼动追踪与注视交互 +1
- 67%
运动签名:虚拟现实中基于运动的用户识别系统研究
CHI '24· 眼动追踪与注视交互 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581201
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
眼动追踪与注视交互、人体姿态与行为识别
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文