分类头部运动以区分头部注视和头部手势作为不同的输入模式

眼动追踪与注视交互人体姿态与行为识别

文献标题

Classifying Head Movements to Separate Head-Gaze and Head Gestures as Distinct Modes of Input

文献信息

  • 主题领域: 人机交互、机器学习、虚拟现实交互
  • 关键词: Head Gestures, Eye Tracking, Virtual Reality, Eye-head Coordination, Computational Interaction, Machine Learning, XGBoost

研究背景与问题

  • 发现的问题或挑战:

    • 头部移动常被看作一种单一类型的输入,但实际上存在两种本质不同的类型:Head-Gaze(伴随眼动的头部运动)和 Head Gestures(独立于眼动的头部手势)。
    • 当前的头部跟踪界面没有区分这两种输入模式,导致它们互相干扰,例如因 Head-Gaze 产生的误触发或因 Head Gestures 的遗漏而影响交互的流畅性。
    • 已有的基于阈值的分类方法准确性不足,无法有效分离这两类运动。
  • 重要性:

    • 区分 Head-Gaze 和 Head Gestures 能够发挥每种移动模式的优势,为人机交互设计带来更精准、更自然的用户体验。
    • 在虚拟现实(VR)/增强现实(AR)等场景中,头部输入越来越多地被用于无触控的交互方式,但其分类与筛选机制仍有待改进。
  • 研究动机与相关工作:

    • 灵感来源于 Sidenmark 等人的 BimodalGaze 方法,该方法尝试通过基于阈值的规则分离 Head-Gaze 和 Head Gestures,但效果有限。
    • 机器学习方法在头部运动行为建模等领域已有初步尝试,但尚未针对区分 Head-Gaze 和 Head Gestures 提出具体解决方案。

解决方案

  • 提出的方法或解决方案:

    • 开发了一种名为 HeadBoost 的机器学习分类器,基于大量训练数据自动区分 Head-Gaze 和 Head Gestures。
    • 使用 XGBoost 算法,结合诸多特征(如形态、噪声、时序和相关性特征),显著提升分类准确性。
  • 创新点:

    • 提出了清晰区分 gaze-driven 和 gaze-independent 头部移动的概念并实现分类。
    • 与以往基于简单阈值的分类器不同,HeadBoost 通过机器学习模型捕获更复杂的运动模式与特征。
    • 设计了独特的实验任务和数据采集方法以自动标注分类数据,避免主观人工标注引入的人为误差。
  • 实施步骤与技术:

    1. 数据采集:

      • 在虚拟现实环境中设计任务,参与者完成眼球注视(Head-Gaze)和头部手势(Head Gestures)的交替任务。
      • 记录头部位置、眼球方向等数据并自动标注为 Head-Gaze 或 Head Gestures。
      • 收集了来自 18 名参与者的超过 119 万条带时间戳的数据样本。
    2. 特征提取:

      • 提取 5 大类特征,包括形态特征(如速度、加速度等)、噪声特征(如标准差、分散度等)、时序特征(如从最后一次扫视的时间)、频谱特征和相关性特征。
      • 采用相关性筛选等方法从多个特征中挑选出 81 个最相关的特征。
    3. 模型开发与训练:

      • 选用 XGBoost 模型进行训练,采用用户独立(user-independent)和用户相关(user-dependent)方法分别验证分类器的性能。
      • 不同的时间窗口和采样率也被测试以优化模型表现。

研究成果

  • 具体成果:

    • HeadBoost 在用户独立的测试中实现了较高的分类性能:?1-Score 达到 0.89,显著高于基线方法(?1-Score:0.62)。
    • 分类器还解决了基线方法无法检测低速头部手势的问题,并能提前 119ms 检测到手势的开始。
  • 与现有方法相比的优势:

    • 明显提高了分类性能。
    • 能有效区分速度较慢或较精细的头部手势,而不依赖固定的阈值。
    • 建立了基于机器学习的通用模型,适应不同用户的个体差异。
  • 实验或评估结果:

    • 用户独立模型的 ?1-Score 和 AUC 等指标均高于用户相关模型,证明了该方法可用于通用场景。
    • 实验中提炼了头部运动的适用范围:最小可控旋转角度约为 0.3°,最大舒适角度约为 40°。
  • 局限性与未来方向:

    1. 实验范围有限:
      • 当前实验要求参与者保持静坐,仅允许头部旋转,未来需扩展至包括躯干运动和动态环境的情况。
    2. 设备限制:
      • 数据采集主要依赖 VR 头显,其结果可能因为低精度设备在真实场景中的表现而受到影响。
    3. 实时性限制:
      • 当前分类器运行速率为 30Hz,未来研究可通过降维优化模型提高响应速度。
    4. 应用评价不足:
      • 虽已提出三种示例应用,但尚未通过用户实验对它们进行广泛验证。
    5. 意图识别问题:
      • 分类器无法直接判断头部运动是否具有交互意图,未来需结合更复杂的行为理解技术优化。

总结

本文通过设计高效的机器学习分类器 HeadBoost,成功区分 Head-Gaze 和 Head Gestures,为头部驱动的人机交互提供了新的可能性与实践路径。HeadBoost 的创新使交互设计能够在提高精确度的同时,提供更自然的体验并避免误触发,适用于 AR/VR 等新兴应用领域。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/96488/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581201
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
眼动追踪与注视交互、人体姿态与行为识别
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文