基于注视的选择的自适应模型

眼动追踪与注视交互人体姿态与行为识别

文献标题

An Adaptive Model of Gaze-based Selection

文献信息

  • 主题领域: 人机交互和眼动追踪技术
  • 关键词: 强化学习, 注视点选择, 自适应模型, 计算理性, 眼动控制, 部分可观测马尔科夫决策过程 (POMDP)

研究背景与问题

  • 问题或挑战:
    • 注视点选择(以眼动控制为基础的输入方法)的性能研究存在不一致的结果,部分表现在与其他输入方法(如鼠标和头部指向)的比较中。
    • 现有模型侧重于运动限制,忽略视觉约束对注视点选择的影响。
    • 注视点选择中复杂的眼动序列和选择策略缺乏明确的机制理解和理论模型。
  • 重要性:
    • 使用注视点选择可实现更快捷、直观和无手操作的人机交互,而理解相关机制有助于优化该技术在虚拟/增强现实中的应用。
    • 发展更准确的认知和计算模型,对改善注视点交互技术及设计具有重要指导作用。
  • 研究动机与相关工作:
    • 通过建模眼动序列和注视点选择机制,探讨视觉和运动系统约束对策略决策的影响。
    • 本研究期望使用基于强化学习的模型,更好地匹配人类实验结果,超越传统的仅基于经验数据的拟合方式。

解决方案

  • 提出的方法或解决方案:
    • 提出一个基于部分可观测马尔科夫决策过程 (POMDP) 的注视点选择模型。
    • 利用强化学习算法优化政策,使模型控制策略在视觉和运动系统的约束条件下达到"有界最优"。
    • 关键假设:注视点选择是为优化效用函数(如选择时间和精度)的策略,其受视觉和运动系统属性的约束。
  • 创新之处:
    • 提供了一种能够预测注视点选择行为的数学框架,通过强化学习有效模拟人类注视点控制策略。
    • 模型不仅预测任务总完成时间,还能逐步模拟眼动控制的每一步反应。
    • 与传统模型不同,不依赖大量人类数据训练,而是在人工世界中通过试错学习自适应。
  • 实施步骤及关键技术:
    1. 建模注视点选择任务为POMDP问题,定义状态、动作、观测、奖励函数及转移函数。
    2. 模拟眼动的视觉和运动噪声特性:定义眼动的信号相关噪声、视觉位置的不确定性、注视点漂移。
    3. 使用深度强化学习算法(Proximal Policy Optimization, PPO) 解决POMDP并训练模型。
    4. 将模型结果与实验数据对比(如Schuetz 2019与Zhang 2010中的人类注视点选择实验)。

研究成果

  • 具体成果:
    • 模型成功预测与实验结果一致的五个关键行为现象,包括目标大小与选择时间、停留时间、眼动次数之间的关系。
    • 模型说明较小目标需要更多的矫正性扫视以完成选择任务,并在不同目标条件下准确计算眼动策略。
  • 与现有解决方案相比的优势:
    • 提供了对注视点选择机制深层次的认知,可以解释现有模型无法描述的复杂眼动行为。
    • 可在单一实验点校准模型参数,而无需拟合全数据集。
  • 实验或评估结果:
    • 模型对于目标选择时间的预测与实验结果的均方根误差 (RMSE) 在合理范围:如针对Zhang 2010,全体目标准确性达54.5毫秒。
    • 实验验证了模型的适应性,显示随着目标距离、大小增加,选择时间占主导的要素是矫正性扫视的出现次数。
  • 局限性与未来方向:
    • 实验发现模型可能对较小目标(<1°)的注视行为略有高估,这可能部分因眼动跟踪设备的精度限制未被完全纳入。
    • 模型当前假设固定的注视漂移范围,未来可考虑让漂移范围自适应目标大小。
    • 潜在方向包括:扩展模型以自适应视觉偏差(如基于当前注视点的目标估计偏差)、引入更多动态场景下的实验验证等。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/47663/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445177
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
眼动追踪与注视交互、人体姿态与行为识别
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文