模拟人类视听搜索行为
作者
眼动追踪与注视交互声音化(Sonification)与听觉显示情感反馈与情绪调节界面UI/UX 设计师AI/ML 研究员与工程师HCI 研究员
文献标题
Simulating Human Audiovisual Search Behavior
出版信息
- 主题领域: 沉浸式环境中人类视听搜索行为的计算建模。
- 关键词: 视听搜索, 资源理性, POMDP, 强化学习, 具身认知, 人机交互, 虚拟现实, 多感官整合, 决策, 模拟。
背景与问题
- 问题/挑战: 现有的视听搜索模型通常将感知与行动分开处理,未能捕捉人类在不确定性条件下如何自适应地协调感官与身体策略。
- 重要性: 理解和模拟人类视听搜索行为可以改进沉浸式环境(如VR、MR和辅助技术)中界面和系统的设计。
- 动机与相关工作: 先前的研究包括用于感官整合的贝叶斯模型和主动感知框架,但这些研究往往忽略了具身行动或专注于单一模态任务。本文通过在统一框架中整合感官推断与资源理性决策,填补了这一空白。
解决方案
- 提出的方法: Sensonaut,一个具身视听搜索的计算模型,形式化为部分可观测马尔可夫决策过程(POMDP),并通过强化学习进行训练。
- 创新点:
- 一个资源理性模型,将线索整合与具身行动成本下的决策统一起来。
- 将模型实现为POMDP,模拟类似人类的搜索策略和错误。
- 一个新的VR中人类视听搜索行为数据集,系统地变化任务复杂性。
- 过程与关键技术:
- Sensonaut整合听觉和视觉线索,更新目标位置的信念分布。
- 模型使用资源理性策略,在信息增益与身体成本(如头部转动、移动)之间平衡。
- 采用强化学习(PPO)来近似不确定性条件下的最优策略。
- 通过一项VR研究验证模型,参与者在受控条件下搜索发声目标。
结果
- 具体发现:
- Sensonaut再现了关键的人类行为,包括高准确率(94.7%)、在干扰物存在时更长的搜索时间,以及更多依赖头部转动而非移动。
- 模型解释了准确率的35%方差、搜索时间的26%、头部转动的58%和位移的6%。
- 它还复现了人类的错误模式,如遮挡驱动的错误(35%)和干扰物引起的混淆(33%)。
- 相较基线的优势:
- 与以往模型不同,Sensonaut捕捉了视听搜索的具身动态,包括准确性、时间与努力之间的权衡。
- 它不仅预测成功率,还预测了搜索轨迹和典型的人类错误。
- 实验/评估:
- 一项包含12名参与者(270次试验)的VR研究系统地变化了目标角度、物体数量和干扰物。
- 因变量包括准确率、搜索时间、头部转动和位移。
- Sensonaut在相同的地图上进行评估,并将结果与人类数据进行比较。
- 局限性与未来工作:
- 模型缺乏细粒度的具身动态(如连续运动)和人类表现出的接近性偏差。
- 视觉似然被视为二值化,导致某些情况下过早的确定性。
- 未来工作包括扩展数据集、纳入个体差异以及优化动作空间。
总结
本文介绍了Sensonaut,一个整合多感官感知与资源理性决策的具身视听搜索计算模型。通过VR研究中的人类数据验证,该模型再现了人类行为的关键模式,包括搜索策略、准确性和错误模式。Sensonaut为模拟和理解视听搜索提供了一个有原则的框架,可应用于XR、辅助系统和交互设计。尽管模型在大多数指标上与人类行为一致,但未来需要改进以解决在移动性和视觉处理上的差异。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790614
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
眼动追踪与注视交互、声音化(Sonification)与听觉显示、情感反馈与情绪调节界面
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文