GazeChat:通过注视感知和交互式 3D 照片增强虚拟会议

眼动追踪与注视交互VR 中的社交与协作混合现实工作空间UI/UX 设计师

文献标题

GazeChat: Enhancing Virtual Conferences with Gaze-aware 3D Photos

文献信息

  • 主题领域: 虚拟会议系统中的视线感知与增强技术
  • 关键词: 视线感知, 眼神交互, 视频会议, 网络化协作, 深度学习, 隐私保护, 用户体验, 低带宽, 增强现实技术

研究背景与问题

  • 发现问题或挑战:
    • 用户在虚拟会议中通常关闭摄像头,导致缺乏交流中的视线信息。
    • 即使开启摄像头,传统视频会议也无法准确传达“谁正在看谁”的信息。
    • 虚拟会议面对隐私保护需求和有限的网络带宽挑战。
  • 重要性:
    • 视线感知是非语言交流的重要线索,能够提升互动性与参与感。
    • 提供视觉化交互的解决方案不仅增强会议体验,还能够平衡隐私保护与带宽需求。
  • 研究动机与相关工作:
    • 现有技术如GAZE-2和TeleHuman等需要昂贵的多摄像机或专用硬件环境,难以推广。
    • 商业化软件(如Memoji)主要关注头像动画化,但忽略会话中的相对视线感知。
    • 作者探讨一种低成本、大众化的系统,通过普通摄像头实现视线感知并优化虚拟会议体验。

解决方案

  • 方法或解决方案:
    • 提出"GazeChat",一种虚拟会议系统,使用普通摄像头跟踪用户视线并以3D动态照片呈现“视线感知”。
  • 创新之处:
    • 采用基于深度学习的图像合成方法,生成具有不同视线角度的动态照片。
    • 使用轻量级WebRTC框架,减少网络带宽的使用,同时保护用户隐私。
    • 基于相对视线信息,而非绝对眼睛位置进行表达。
  • 实施步骤与关键技术:
    1. 输入数据: 用户上传个人静态头像照片,并使用摄像头进行实时会话。
    2. 深度图与图像合成: 利用深度估计模型生成各角度视觉图像,通过预训练的First Order Motion模型进行眼睛移动动画化。
    3. 实时视线跟踪: 基于WebGazer.js或Tobii眼动跟踪设备,记录用户在屏幕上的视线焦点。
    4. 渲染模块: 使用三维重构与前端渲染库Three.js,呈现基于用户视线的动态3D头像。
    5. 数据传输优化: 服务器仅需传输少量空间位置与音频数据,减轻网络压力。

研究成果

  • 具体成果:
    • GazeChat成功实现了“谁正在看谁”的可视化,增强用户的参与和交流体验。
    • 与传统音频会议和视频会议相比,GazeChat显著提高了社会存在感和会话效率。
  • 优势:
    • 比视频会议更节省带宽、保护隐私。
    • 比音频会议更具互动性与视觉信息支持。
    • 操作简单,适配普通硬件环境(例如笔记本电脑、普通摄像头)。
  • 实验结果:
    • 用户实验表明GazeChat提高了会议中的眼神交流感知,用户对系统的新颖性和趣味性给予较高评价。
    • GazeChat在社会丰富性(如互动性、情感反馈)、用户体验及用户参与度上优于传统音频会议。
  • 局限性与未来方向:
    • 当前版本仅包含眼睛动态信息,对于其他视觉线索(如表情或身体动作)支持有限。
    • 视线跟踪算法依赖准确的校准,容易受到用户姿态和环境光照影响。
    • 用户研究的年龄跨度较小,需进一步扩展至其他群体(如学生或老年人)。
    • 未来系统可以集成更多非语言信息(如面部表情、身体姿态),提升自然互动性。

此文献为虚拟会议系统的研究和设计提供了一种低成本、轻量级、多功能的解决方案,并对未来虚拟协作场景的开发提供了重要启发。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/61357/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3472749.3474785
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
眼动追踪与注视交互、VR 中的社交与协作、混合现实工作空间
work
职业/产业
UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
5 篇相关论文