改进虚拟现实中的无视觉空中盲打手指击键识别率

眼动追踪与注视交互普适计算(Ubiquitous Computing)

文献标题

Improving Finger Stroke Recognition Rate for Eyes-Free Mid-Air Typing in VR

文献信息

  • 主题领域: 人机交互 (Human-Computer Interaction) — 针对虚拟现实 (VR)中的无设备中空打字技术进行指击识别优化研究
  • 关键词: Mid-Air Typing, Eyes-free Typing, Text Entry, Deep Neural Network, Keystroke Classification

研究背景与问题

  • 发现的问题或挑战:

    • VR应用中需要大量的文本输入,而现有的文本输入方式(如手持控制器、触屏或物理键盘)效率低下或带来视觉遮挡问题。
    • 无设备中空打字(freehand typing in mid-air)方法不需要物理设备,但受到手指弯曲协同运动等生理限制,导致指击和按键分类准确度较低。
    • 非约束性(unconstrained)中空打字,用户无法从视觉或物理键盘反馈中获取提示,进一步增加指击识别的复杂性。
  • 重要性:

    • 准确的指击识别能够提升用户在VR环境中进行眼自由中空打字的体验,并为高效文本输入提供技术支持。
    • 改进中空打字技术可减少视觉障碍,同时提高VR应用中的文本输入速度和准确率。
  • 研究动机与相关工作:

    • 作者通过分析现有的中空打字方法性能以及用户手指运动数据发现,手指弯曲的幅度和活动相关性限制了指击识别的有效性。
    • 本文基于相关工作提出改进的方法,从特征选择、分类模型评估到语言模型集成,旨在提高指击识别率。

解决方案

  • 提出的方法或解决方案:

    1. 数据采集: 利用高精度手指运动追踪设备(Leap Motion 和 OptiTrack)采集手指的3D运动轨迹。
    2. 特征分析: 提取运动学(kinematic)特征(位置、速度、方向和加速度)与时间特征(前一个按键与前一个手指)。
    3. 分类模型: 比较四种分类器(Naive Bayes、SVM、随机森林、深度神经网络)的性能,选取最佳模型。
    4. 语言模型集成: 通过字符语言模型(基于RNN)结合键分类模型,提升识别率。
  • 创新点:

    • 综合分析复杂手指运动数据的运动学及时间特征对指击识别的影响。
    • 设计了一个以深度神经网络为核心的分类器,并集成字符语言模型以增强键分类的准确性。
    • 构建了一个完整的指击识别管道,从数据采集、特征提取到模型训练。
  • 实施步骤与关键技术:

    1. 数据处理: 清理并标签化3D手指运动数据;处理来自不同设备(Leap Motion 和 OptiTrack)的坐标系差异。
    2. 特征评估: 使用随机森林分类器分析运动学和时间特征的重要性。
    3. 模型比较: 使用交叉验证技术比较模型性能。
    4. 语言模型训练: 基于Wikicorpus数据集训练字符语言模型,并与分类模型做加权融合。

研究成果

  • 具体成果:

    • 特征性能分析结果:
      • 指击分类中,位置和方向特征准确率最高(约91%);时间特征(如前一个手指与按键)能进一步提升准确率。
      • 按键分类中,运动学和时间特征的总体表现有所下降,但仍显示出较高准确率(约89%)。
    • 分类模型评估结果:
      • 深度神经网络模型在指击分类(96.4%准确率)和按键分类(91.7%准确率)表现最佳。
      • Naive Bayes模型表现最差。
    • 语言模型集成效果:
      • 集成语言模型后,按键分类准确率提高2.4%,最终达94.1%。
  • 优势:

    • 提高了中空打字指击识别的准确率,特别是在没有视觉反馈的非约束性情况下。
    • 深度神经网络和语言模型的结合展示了利用上下文信息优化分类的潜力。
  • 实验与评估结果:

    • 作者通过20名触摸打字用户的大规模实验数据(30,901次指击轨迹),验证了分类器的性能和特征选择的有效性。
    • RNN语言模型在预测每个单词的最后字符时表现尤为显著。
  • 局限性与未来方向:

    • 局限性:
      • 仅研究了触摸打字用户的打字行为,未覆盖其他经验较少的用户群体。
      • 数据采集仅支持Leap Motion和OptiTrack设备,未覆盖其他追踪技术。
    • 未来扩展方向:
      • 设计实时指击检测系统,能动态识别手指的最大弯曲点以实现实时分类。
      • 改进数据标注过程,通过自动标签技术加速数据处理。
      • 扩展研究到非触摸打字用户群体,探索更广泛的打字行为模式。

结论

本文提出了一种提高VR环境下眼自由中空打字指击识别率的解决方案,并通过大规模数据收集与深度学习模型评估验证了方案的有效性。研究展示了运动学特征、深度神经网络分类器以及语言模型在提升分类准确性的显著作用,同时构建了一个完整的指击识别管道,为VR文本输入的未来发展提供了重要参考。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/68903/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3502100
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
眼动追踪与注视交互、普适计算(Ubiquitous Computing)
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文