RealityTalk:用于AR现场叙事的实时语音驱动增强现实演示系统

AR 导航与情境感知互动叙事与沉浸式故事UI/UX 设计师舞者与表演艺术家

文献标题

RealityTalk: Real-Time Speech-Driven Augmented Presentation for AR Live Storytelling

文献信息

  • 主题领域: 人机交互 (HCI)、增强现实 (AR)
  • 关键词: 增强现实, 混合现实, 增强型演示, 自然语言处理, 手势识别, 视频实时处理

研究背景与问题

  • 发现的问题或挑战:

    1. 传统利用嵌入视觉效果和动画的增强型演示需要视频后期制作工具(如 Adobe After Effects),需要耗费大量时间和专业知识。
    2. 即使近年出现的实时演示工具(如 Prezi Video 和 mmhmm.app),也普遍存在较为线性和脚本化的限制,缺乏必要的互动性和即兴性。
    3. 现有工作主要集中于手势驱动或绘图驱动增强型演示,而基于语音驱动的增强型互动技术尚未得到充分探索。
  • 为什么重要:

    • 增强型演示在教育、商业、直播带货等领域潜力巨大,通过动态信息呈现增强了观众体验。
    • 实时语音驱动的演示可以缩短准备时间,提高互动性和即兴创作能力。
  • 研究动机与相关工作:

    • 现有研究多集中于通过手势驱动(如 Interactive Body-Driven Graphics)或绘图互动实现的增强演示,基于语音的即兴增强型演示是一个全新领域。
    • 通过对 177 个带有增强效果的视频进行分析,发现语音在触发多样化视觉和文本元素方面具有关键作用,提出进一步研究语音驱动方法的必要性。

解决方案

  • 方法与解决方案: RealityTalk 是一个实时语音驱动的增强演示系统,能够通过演讲实时生成和操控交互式虚拟元素,用户可以通过语音和手势与增强文本和视觉对象互动。

  • 创新点:

    1. 提出了一种基于语音驱动的实时增强型演示方法,这是改善现有线性演示方式的重要路径。
    2. 提炼现有视频编辑增强演示中的交互技术,设计了一个新的交互技术和设计空间。
    3. 提供了从准备到展示的完整实时增强演示工具。
  • 实施步骤与关键技术:

    1. 交互设计:
      • 系统用语音识别(WebSpeech API)和自然语言处理(Transformer-based NLP,引入 spaCy)抽取演讲中的关键字。
      • 用用户预定义的关键字和视觉元素进行匹配,结合实时手势检测(MediaPipe)实现互动。
    2. 视觉嵌入:
      • 使用 React.js、Konva.js 和 A-Frame 实现 2D 和 3D 图像/视频的实时渲染。
      • 通过 8th Wall 实现 3D 世界和物体跟踪,用于识别水平或垂直表面以及物体绑定。
    3. 用户交互:
      • 提供简易的关键词匹配表,允许用户预先关联内容,并支持最低准备成本的即兴演示。
      • 为手势操控提供多种交互操作,如位置指定、拖动、缩放、旋转及删除。

研究成果

  • 具体成果:

    1. 提出 RealityTalk 系统框架,支持以语音触发的增强文本和视觉元素交互。
    2. 提炼了 177 部视频示例中的交互行为,定义了增强演示的四个核心维度:文本元素、视觉元素、元素位置与元素交互。
    3. 系统的用户评估表明,RealityTalk 能够有效地支持半结构化的即兴增强型演示。
  • 优势:

    • 提高了实时演示的灵活性和互动性。
    • 不需过于复杂的硬件,可运行在普通电脑或常见的网络摄像环境。
  • 实验或评估结果:

    1. 用户测试包括 15 名参与者,结果显示 RealityTalk 平均评分为 5.4/7(易用性评分为 5.8/7,准备阶段评分为 5.7/7)。
    2. 系统误差分析:
      • 手势交互错误:手势追踪失败平均约 2.36 次,文字拖动或缩放交互存在灵敏度过高问题。
      • 语音识别错误:关键词识别失败(平均 0.5 次),识别错误或未触发对应元素。
      • 元素显示错误:包括位置偏移、重复显示等问题。
    3. 系统平均响应延迟为大约 1.47 秒,关键词触发动画总体适应实时应用需求。
  • 局限性与未来方向:

    1. 局限性:
      • 系统语音和手势识别在个别情况下精度有限,尤其是 WebSpeech API 对口音的兼容性存在不足。
      • 高度自定义的演示功能仍需后续开发,支持更多复杂的需求场景。
    2. 未来方向:
      • 优化关键词-视觉关联实现更高效的半自动辅助建议。
      • 扩展场景以支持课堂教学、直播间互动;甚至尝试在 HMD(混合现实头戴式设备)或空间投影的应用。
      • 针对完全即兴的讨论和交流情境(如头脑风暴)开发增强交互功能。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/85010/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3526113.3545702
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
AR 导航与情境感知、互动叙事与沉浸式故事
work
职业/产业
UI/UX 设计师、舞者与表演艺术家
article
内容状态
已索引正文
hub
相关论文
3 篇相关论文