语音增强的视锥范围用于探索性数据分析

眼动追踪与注视交互VR 中的社交与协作交互式数据可视化大学教授与研究人员HCI 研究员

文献标题

Speech-Augmented Cone-of-Vision for Exploratory Data Analysis

文献信息

  • 主题领域: 人机交互、协同虚拟现实、数据可视化与分析
  • 关键词: 视域锥体(Field of View, CoV)、多模态视觉注意力、VR协同分析、语音识别、眼动追踪

研究背景与问题

  1. 发现的问题:

    • 在协作环境中,提高对其他人的视觉注意力的了解是成功协作的关键。
    • 现有的基于视域和头部方向的注意力限制无法动态反映不同类型的注意力(如聚焦和分散注意力)。
    • 基于眼动的视觉提示可能受限于设备配置、校准问题,以及在某些情况下对观察者具有干扰性。
  2. 重要性:

    • 随着虚拟现实设备应用的普及及COVID-19期间远程工作的需求增加,提升协作环境中的共同注意力和视觉提示的准确性,尤其是对于没有眼动追踪功能的低成本VR设备,具有重要意义。
  3. 研究动机与相关工作:

    • 结合多模态线索(如头部方向和语音内容)以提高视觉注意力推断的准确性,并改善协作质量。
    • 研究已经展示了视域可视化可以增强协作,但关于如何动态调整视域大小以适应语音输入尚存探索空间。

解决方案

  1. 提出的方法:

    • 引入“语音增强视域锥体(CoV+Speech)”,结合用户的头部行为与协作语音输入动态调整视域以改善注意力推断。
    • 使用语音识别技术,通过捕获关键词来缩小视域锥体,明确数据可视化的焦点区域。
  2. 创新性:

    • 将语音识别与多模态视觉注意结合,使视域锥体动态适应用户的协作语音行为。
    • 提出了结合头部方向和语音语义的联合方式进行视觉注意力推断,弥补传统基于头部或眼动的单线索局限性。
  3. 实施步骤与关键技术:

    • 视域锥体建模: 使用统计模型基于头部方向生成视域锥体。
    • 语音处理: 通过实时语音识别捕获用户谈话中提到的关键词,在HTML页面中搜索关键词的位置并动态调整视域。
    • 视觉提示动态展示: 根据关键词的分布绘制椭圆区域,并通过插值调整视域锥体显示。

研究成果

  1. 具体成果:

    • 提出了动态调整视域锥体大小的视觉注意力提示,可在多模态环境中更有效地支持协作。
    • 释放了基于头部方向、眼动数据及协作语音数据的公开数据集。
  2. 与现有解决方案的比较:

    • 视域锥体(CoV)在屏幕级的共同注意力提升上比眼动光标更具优势,令协作双方在屏幕级区域有20%的共同注意力提升。
    • 语音增强方案(CoV+Speech)在非实时实验中有效提升眼动推断的精确性,使得精度提高约50像素,在一定条件下超过单纯基于头方向的注意力推断。
  3. 实验或评估结果:

    • 在三个实验条件(CoV、CoV+Speech、Eye-Gaze Cursor)中,共记录179段交互数据,验证了头部方向配合语音输入的有效性。
    • 问卷与访谈进一步强调了视域锥体在初始视觉对齐方面的优势及语音技术受限因素。
  4. 局限性与未来方向:

    • 局限性: 实验中语音识别的实时准确性和延迟问题影响了CoV+Speech的表现。且现有技术无法捕获空间语义输入(如“左上角”)。
    • 未来方向:
      • 结合头部方向与眼动技术的混合方案,改善对注意力动态表现的支持。
      • 扩展在三维数据上的应用,解决遮挡与实时环境变化问题。
      • 优化语义处理技术以支持更复杂的语音空间参考。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/95852/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581283
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
眼动追踪与注视交互、VR 中的社交与协作、交互式数据可视化
work
职业/产业
大学教授与研究人员、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文