文献标题

OmniScribe: Authoring Immersive Audio Descriptions for 360° Videos

文献信息

  • 作者: Ruei-Che Chang, Liang-Jin Chen, Chao-Hsien Ting, Yu-Tzu Chao, Chia-Sheng Hung, Bing-Yu Chen, Wan-Chen Lee, Anhong Guo
  • 发表会议: UIST '22, Bend, OR, USA
  • 发表时间: 2022年10月29日-11月2日
  • DOI: https://doi.org/10.1145/3526113.3545613
  • 主题领域: 可访问性技术和人机交互
  • 关键词: 360° 视频, 音频描述, 虚拟现实, 多媒体, 无障碍技术, 视觉障碍, 声音可视化, 计算机视觉, 移动应用

研究背景与问题

  • 发现的问题:

    • 为盲人和视障者(BVI)提供视频可访问性主要依赖音频描述(AD),但360°视频的全方位视觉内容和空间信息的复杂性使得音频描述的撰写更加困难。
    • 当前标准音频描述的方式未能体现360°视频的沉浸式优势,从而可能无法为盲人用户提供与视力正常用户类似的体验。
    • 很多描述者在面对360°内容时感到挑战,包括难以全景观察、多重点区域的优先级选择以及时间限制问题。
  • 重要性:

    • 360°视频是未来多媒体传播的重要形式,提供沉浸式体验。而通过改进音频描述,可以减少盲人与视力正常用户之间的数字鸿沟。
    • 提升音频描述的沉浸感不仅能够改善盲人的视频体验,也能推动沉浸式媒体在无障碍技术领域的应用。
  • 研究动机与相关工作:

    • 传统的音频描述工具主要集中于二维视频,且很多描述是为标准观影体验设计,不能很好地适应360°内容。
    • 现有研究提到了通过空间音频和互动方式提升360°音频描述的潜力,但尚缺乏具体的设计框架和工具,且对描述者和盲人用户的需求理解有限。

解决方案

  • 提出的方法:

    • 开发了OmniScribe,一个支持360°视频沉浸式音频描述创作的系统。
    • OmniScribe包括两个核心组件:一个基于Web的创作界面(供描述者使用)和一个移动端原型应用(供盲人用户观看体验)。
  • 创新之处:

    • 提供了基于AI生成的可视化内容辅助功能(如区域分区、显著性叠加和对象跟踪),帮助描述者快速理解360°视频内容。
    • 首次提出三种“沉浸式标签”:空间音频描述、场景描述和对象描述,提升盲人用户的沉浸式交互体验。
    • 系统支持从低门槛入手,适应不同技术水平的描述者。
  • 实施步骤与关键技术:

    1. 内容理解辅助组件: 提供全景视频的等距投影和局部视野;添加区域分区边界、显著性对象轮廓以及对象跟踪叠加层。
    2. 沉浸式标签创建: 描述者可以使用工具创作与视频场景空间相关的音频描述,并能通过标注移动路径和方向生成对象描述。
    3. 多模态交互设计: BVI用户通过移动端应用感受到震动提示和方向性的AD音频,同时可以通过移动设备探索虚拟对象位置。
    4. 视频预处理流水线: 包括AI驱动的场景切割、音频分段、显著性检测和对象跟踪技术。

研究成果

  • 具体成果:

    • 开发了OmniScribe系统并成功实现了核心功能。
    • 通过实验展示OmniScribe在描述者创作流程中的有效性,以及盲人用户对其生成的沉浸式音频描述的体验改进。
  • 优势比较:

    • 与标准AD工具相比,OmniScribe显著提升了描述者处理360°内容的效率和全面性,同时支持为盲人用户提供沉浸式的交互方式。
    • 实验数据表明,与标准AD相比,盲人用户更多地偏好OmniScribe生成的沉浸式AD,并认为其信息充实度更高。
  • 实验或评估结果:

    • 用于描述者的评估:
      • 参与者构成: 8名初学者和3名专业描述者。
      • 结果: 初学者评价OmniScribe的学习曲线略高,但普遍认同其功能丰富;专业描述者认为系统显著增强了对视频空间信息的理解。
    • 用于BVI用户的评估:
      • 参与者构成: 8名盲人用户(年龄范围20-32岁)。
      • 结果: 所有用户均对“对象描述”功能表示高度认可,绝大多数人更喜欢OmniScribe版本的描述,认为其互动性和沉浸感更强。
  • 局限性与未来方向:

    • 局限性:
      • 描述者在时间紧迫情况下选择重点内容存在困难。
      • 提供沉浸感的同时,可能加重用户的认知负担。
    • 未来方向:
      • 探讨如何更好地平衡认知负载和信息沉浸感。
      • 引入更多互动技术,提高移动端交互体验,如触摸手势或深度声音反馈。
      • 支持基于用户兴趣的个性化描述生成和呈现,进一步推广到其他无障碍多媒体领域。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/85021/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3526113.3545613
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
work
职业/产业
辅助技术专家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文