利用虚拟现实中的眼动动态检测输入识别错误和用户错误
作者
眼动追踪与注视交互人体姿态与行为识别沉浸感与临场感研究UI/UX 设计师HCI 研究员
文献标题
Detecting Input Recognition Errors and User Errors using Gaze Dynamics in Virtual Reality
文献信息
- 主题领域: 人机交互 (HCI)、虚拟现实 (VR)、眼动追踪
- 关键词: 输入识别错误, 用户错误, 眼球行为, 视线动态, 眼动追踪, 自适应用户界面
研究背景与问题
-
发现的问题/挑战:
- 虚拟现实 (VR) 交互中,手势识别可能出现输入识别错误和用户错误,这对用户体验造成显著负面影响。
- 当前的识别系统难以完全避免这些错误。
- 错误分类和检测尚未在多任务场景中得到验证,尤其是在自然发生的错误中。
-
重要性:
- 错误的及时识别和分类能够提高系统的个性化与适应性,降低用户交互成本。
- 对输入识别错误和用户错误的准确识别,可以完善交互设计并提升整体用户体验。
-
研究动机与相关工作:
- 先前工作(例如 Peacock 等人研究)探讨了基于眼动的二分类模型,但其研究集中在单一任务且使用人工注入的错误,没有在复杂任务和自然错误中验证泛化性。
- 本研究旨在通过跨任务验证来拓展先前模型的应用范围,并提出可用于三分类的深度学习解决方案。
解决方案
-
提出的方法:
- 开发基于深度学习的眼动追踪模型,通过用户自然的眼球运动行为(视线动态)来分类以下三类输入事件:
- 有意的正确动作 (Intentional actions)
- 输入识别错误 (Input recognition errors)
- 用户错误 (User errors)
- 提出跨任务的一致性验证,确保模型适配不同任务场景。
- 开发基于深度学习的眼动追踪模型,通过用户自然的眼球运动行为(视线动态)来分类以下三类输入事件:
-
创新之处:
- 提出了基于时间序列的卷积神经网络(Temporal Convolutional Network, TCN),用于识别和分类眼动特征,适用于多个任务。
- 系统地比较了不同任务中的注入式和自然输入错误对用户视线动态的影响,并验证了模型在跨任务、跨用户场景中的泛化能力。
- 梯度推进眼球运动特征,避免传统任务特定特征选择的限制,实现数据驱动的动态模式学习。
-
实施步骤:
- 使用三种任务(Tile Search、Room Search 和 Dice Game)收集眼动数据,并标注输入类型。
- 对原始数据进行预处理和特征提取(包括视线速度、离散分布点等)。
- 提出两个分类假设并通过定量实验验证:
- 假设1 (H1): 不同类型的输入事件特征在时间序列中存在显著差异。
- 假设2 (H2): 相同类型事件的特征在不同任务中具有一致性。
- 使用 TCN 训练和测试分类模型,评估在不同任务和跨任务上的性能。
研究成果
-
具体成果:
- 时间序列特征差异性:
- 不同输入事件(正确动作、识别错误、用户错误)的眼动特征(如凝视概率、扫视振幅等)在时间序列中差异显著。
- 特征的跨任务一致性:
- 尽管任务控制条件(如使用手持控制器 vs 动作识别器)和误差类型有所变化,眼动特征在所有任务中保持一致。
- 类似的模式也可以区分自然发生的输入识别错误和人工注入的错误。
- 深度学习分类性能:
- 单任务分类实验中,模型的 AUC-ROC-OVR 达到 0.75 至 0.84。
- 跨任务分类实验中,联合模型的 AUC-ROC-OVR 达到 0.78。
- 降维分析:
- 低维嵌入空间中的特征分布表明三类输入事件形成清晰的聚类,支持算法的分类性能。
- 时间序列特征差异性:
-
实验评估结果:
- 在 Tile Search、Room Search 和 Dice Game 三种任务中以统一模型实现了对三类事件的高精确预测。
- 实验支持时间序列特征用于分类的可行性和任务独立性。
-
与现有解决方案的比较:
- 相较于以往的两分类模型,本研究支持三分类任务,且适用于更复杂的自然错误和多任务场景。
- 深度学习方法有效提高了鲁棒性,避免了手工挑选特征带来的局限性。
-
局限性与未来方向:
- 局限性:
- 当前分类模型准确性(AUC-ROC-OVR=0.78)虽显著高于随机水平,但实际系统部署还需更高性能。
- 研究局限于点选任务,其他交互模式(如滑动、滚动手势)的眼动趋势尚需进一步验证。
- 未来方向:
- 探索使用多模态数据(如用户手部动作)优化分类模型性能。
- 开发实时错误检测系统并验证对用户交互性能的提升效果。
- 扩展到更多复杂场景,例如多目标选择或多手势输入场景。
- 局限性:
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 在虚拟现实中,用户的自然注视动态如何区别于不同类型的输入事件(有意行为、识别错误、用户错误)?分类: 时间序列语义检索与趋势分析同类问题arrow_forward
- 注视动态的时间序列特征在不同任务和输入事件之间是否具有一致性?分类: 时间序列语义检索与趋势分析同类问题arrow_forward
- 深度学习模型是否能够在跨任务场景中有效分类输入事件类型?分类: 时间序列语义检索与趋势分析同类问题arrow_forward
lightbulb
现实痛点
1- 虚拟现实中,识别错误和用户错误降低了交互体验,且现有系统难以快速分类错误类型。分类: 时间序列语义检索与趋势分析同类问题arrow_forward
- 80%
虚拟现实中的物理键盘:打字性能分析及角色手部影响
CHI '18· 眼动追踪与注视交互 +1
- 80%
FocusFlow:利用主动视觉深度操作在虚拟现实中的3D凝视-深度交互
CHI '24· 眼动追踪与注视交互 +1
- 80%
DEEP:利用眼睑运动的虚拟现实三维注视点交互技术
UIST '22· 眼动追踪与注视交互 +1
- 67%
头耦合运动模板匹配:VR中光线指向的预测模型
CHI '20· 眼动追踪与注视交互 +2
- 67%
复杂世界中的搜索:混合现实中的视觉搜索与空间规律记忆
CHI '26· 沉浸感与临场感研究 +2
- 67%
眼动-头动连续体:虚拟现实中个体与群体头部运动倾向的建模
CHI '26· 沉浸感与临场感研究 +2
- 67%
少即是多!动态环境中自下而上与自上而下注意力的视觉抑制
CHI '26· 沉浸感与临场感研究 +2
- 60%
使用心理物理学方法解释基于凝视的选择任务中类似菲茨定律的表现
CHI '19· 眼动追踪与注视交互
- 60%
专注的面孔:一项关于注意力状态的面部线索的研究
CHI '20· 眼动追踪与注视交互 +1
- 60%
RetroSketch:一种用于测量虚拟现实中情感和临场感的回顾性方法
CHI '25· 沉浸感与临场感研究
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3526113.3545628
一眼看懂
fact_check论文快照
dataset
来源
UIST
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
眼动追踪与注视交互、人体姿态与行为识别、沉浸感与临场感研究
work
职业/产业
UI/UX 设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文