SPICA:通过增强音频描述为盲人或低视力观众互动探索视频内容

视觉障碍者技术(屏幕阅读器、触觉图形、盲文)残障服务提供者辅助技术专家

文献标题

SPICA: Interactive Video Content Exploration through Augmented Audio Descriptions for Blind or Low-Vision Viewers

文献信息

  • 主题领域: 无障碍技术与人机交互
  • 关键词: 交互式视频探索, 音频描述, 无障碍技术, 弱视适配, 视频内容理解, 空间音效, 机器学习, 用户体验, 多模态交互, 视频辅助工具

研究背景与问题

  • 问题与挑战:
    • 当前视频的音频描述 (AD) 存在静态性,导致信息不完整,并且难以满足视障用户的多样化需求。
    • BLV (Blind or Low-Vision) 用户在依赖 AD 时往往负担较高的认知负荷,相较于普通观众缺乏对视频内容的自主探索能力。
    • 现有 AD 提供的信息往往偏简洁,忽略了一些次要视觉元素或细节,限制了用户的沉浸感。
  • 重要性:
    • 随着在线视频内容的快速增长,尤其是用户生成内容的广泛传播,能否为视障用户提供高质量、个性化的描述体验,关系到信息公平和社会包容。
  • 研究动机与相关工作:
    • 以往大量研究探索了视频 AD 的自动化生成及改进方向,但这些模型在准确性、描述丰富度及交互性上存在不足。
    • 在此背景下,亟需一种新方法,能够通过智能技术增强 AD 的细化与互动体验。

解决方案

  • 方法概述:
    • 提出一个名为 SPICA 的 AI 支持系统,允许 BLV 用户通过增强式音频描述 (包括空间音效和对象级描述) 与视频内容互动。
    • SPICA 提供时间轴导航功能,支持在时间和空间维度上探索关键帧,以及对视频中关键对象的详细描述。
  • 创新性:
    • 引入分层的描述方法,使用户可根据需求深入探索场景或对象的详细信息。
    • 使用机器学习技术自动生成帧级及对象级音频描述,无需额外的人类标注。
    • 空间音效的加入,以及对对象位置的描述增强了沉浸感和用户的空间感知。
    • 提供不同的交互方式(触控和键盘操作),便于用户根据个人习惯选择。
  • 实施步骤和技术:
    1. 关键模块:
      • 机器学习流水线: 对场景进行分析分割,检测关键帧及对象,对对象生成描述并添加空间音效。
      • 前端交互功能:
        • 视频播放器,支持帧和对象的探索。
        • 帧级描述导航列表。
        • 对象级描述导航列表。
    2. 技术工具:
      • 场景分析: 使用基于 Mask RCNN 的模型对对象进行分割。
      • 描述生成: 使用 GPT-4 对对象描述进行自然语言优化。
      • 空间音效拓展: 通过 freesound.org 数据库检索与对象相关的声音,并结合 3D 位置对音效进行空间化处理。
      • 用户界面: 使用 React 和 Flask 构建可访问的互动界面。

研究成果

  • 具体成果:
    • SPICA 提高了 BLV 用户对视频内容的理解和沉浸感。
    • 用户能够通过主动探索视频内容感受到更多细节,满足个性化的需求。
    • 技术验证展示了 SPICA 对对象标注和描述生成的高准确性,自动生成的对象描述质量优于基线系统。
  • 与现有方案的比较与优势:
    • 与传统静态 AD 相比,SPICA 的分层描述和交互式功能提供了更精细和灵活的体验。
    • 空间音效和对象级描述为用户提供了更强的场景代入感。
    • 实验显示,使用 SPICA 后用户报告的内容沉浸感与整体体验评分显著提高。
  • 实验与评估结果:
    • 实验中,14 名 BLV 用户参与了对 SPICA 的功能性评价。
    • 用户报告 SPICA 操作简便(平均 6.29 分,满分 7 分),并极大增强了视频内容丰富性(6.57 分)和沉浸性(6.29 分)。
    • 时间导航功能被认为提高了情节连贯性,然而自动暂停机制引发了一定争议。
    • 对象探索功能对用户的空间理解起到辅助手段,有近一半(39.4%)的暂停帧被进一步探索。
  • 局限性与未来方向:
    • 对长视频的适用性尚待进一步评估。
    • 需更好地个性化调整,比如适应不同用户对叙述风格、描述细节的偏好。
    • 提升机器学习模块的描述精确性和用户情境感知能力。
    • 探索更高效的交互方式,包括语音交互及与组内观众的同步观看功能设计。

本研究为视频无障碍设计提供了重要实践启示,未来工作将专注于优化描述生成模型、增强多模态互动体验,并通过上线测试扩大 SPICA 的实际影响力。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/147481/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642632
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
work
职业/产业
残障服务提供者、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文