SPICA:通过增强音频描述为盲人或低视力观众互动探索视频内容
作者
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)残障服务提供者辅助技术专家
文献标题
SPICA: Interactive Video Content Exploration through Augmented Audio Descriptions for Blind or Low-Vision Viewers
文献信息
- 主题领域: 无障碍技术与人机交互
- 关键词: 交互式视频探索, 音频描述, 无障碍技术, 弱视适配, 视频内容理解, 空间音效, 机器学习, 用户体验, 多模态交互, 视频辅助工具
研究背景与问题
- 问题与挑战:
- 当前视频的音频描述 (AD) 存在静态性,导致信息不完整,并且难以满足视障用户的多样化需求。
- BLV (Blind or Low-Vision) 用户在依赖 AD 时往往负担较高的认知负荷,相较于普通观众缺乏对视频内容的自主探索能力。
- 现有 AD 提供的信息往往偏简洁,忽略了一些次要视觉元素或细节,限制了用户的沉浸感。
- 重要性:
- 随着在线视频内容的快速增长,尤其是用户生成内容的广泛传播,能否为视障用户提供高质量、个性化的描述体验,关系到信息公平和社会包容。
- 研究动机与相关工作:
- 以往大量研究探索了视频 AD 的自动化生成及改进方向,但这些模型在准确性、描述丰富度及交互性上存在不足。
- 在此背景下,亟需一种新方法,能够通过智能技术增强 AD 的细化与互动体验。
解决方案
- 方法概述:
- 提出一个名为 SPICA 的 AI 支持系统,允许 BLV 用户通过增强式音频描述 (包括空间音效和对象级描述) 与视频内容互动。
- SPICA 提供时间轴导航功能,支持在时间和空间维度上探索关键帧,以及对视频中关键对象的详细描述。
- 创新性:
- 引入分层的描述方法,使用户可根据需求深入探索场景或对象的详细信息。
- 使用机器学习技术自动生成帧级及对象级音频描述,无需额外的人类标注。
- 空间音效的加入,以及对对象位置的描述增强了沉浸感和用户的空间感知。
- 提供不同的交互方式(触控和键盘操作),便于用户根据个人习惯选择。
- 实施步骤和技术:
- 关键模块:
- 机器学习流水线: 对场景进行分析分割,检测关键帧及对象,对对象生成描述并添加空间音效。
- 前端交互功能:
- 视频播放器,支持帧和对象的探索。
- 帧级描述导航列表。
- 对象级描述导航列表。
- 技术工具:
- 场景分析: 使用基于 Mask RCNN 的模型对对象进行分割。
- 描述生成: 使用 GPT-4 对对象描述进行自然语言优化。
- 空间音效拓展: 通过 freesound.org 数据库检索与对象相关的声音,并结合 3D 位置对音效进行空间化处理。
- 用户界面: 使用 React 和 Flask 构建可访问的互动界面。
- 关键模块:
研究成果
- 具体成果:
- SPICA 提高了 BLV 用户对视频内容的理解和沉浸感。
- 用户能够通过主动探索视频内容感受到更多细节,满足个性化的需求。
- 技术验证展示了 SPICA 对对象标注和描述生成的高准确性,自动生成的对象描述质量优于基线系统。
- 与现有方案的比较与优势:
- 与传统静态 AD 相比,SPICA 的分层描述和交互式功能提供了更精细和灵活的体验。
- 空间音效和对象级描述为用户提供了更强的场景代入感。
- 实验显示,使用 SPICA 后用户报告的内容沉浸感与整体体验评分显著提高。
- 实验与评估结果:
- 实验中,14 名 BLV 用户参与了对 SPICA 的功能性评价。
- 用户报告 SPICA 操作简便(平均 6.29 分,满分 7 分),并极大增强了视频内容丰富性(6.57 分)和沉浸性(6.29 分)。
- 时间导航功能被认为提高了情节连贯性,然而自动暂停机制引发了一定争议。
- 对象探索功能对用户的空间理解起到辅助手段,有近一半(39.4%)的暂停帧被进一步探索。
- 局限性与未来方向:
- 对长视频的适用性尚待进一步评估。
- 需更好地个性化调整,比如适应不同用户对叙述风格、描述细节的偏好。
- 提升机器学习模块的描述精确性和用户情境感知能力。
- 探索更高效的交互方式,包括语音交互及与组内观众的同步观看功能设计。
本研究为视频无障碍设计提供了重要实践启示,未来工作将专注于优化描述生成模型、增强多模态互动体验,并通过上线测试扩大 SPICA 的实际影响力。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何通过增强音频描述提升盲人或低视力用户对视频内容的理解和沉浸感?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- 增强音频描述中的分层式交互机制是否比传统静态音频描述更有效?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- 结合空间音频和对象级描述的系统是否能帮助用户获得更强的场景感知?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
lightbulb
现实痛点
1- 盲人或低视力用户难以全面了解或沉浸于视频内容。分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- 100%
面向视障人士的面部识别应用程序:超越实验室的理解使用
CHI '18· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 100%
使视障人士能够使用触觉和听觉手杖模拟导航虚拟现实
CHI '18· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 100%
转向轮:一种用于低视力网络浏览的保局放大界面
CHI '18· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 100%
Caption Crawler:利用反向图像搜索实现可重复使用的替代文本描述
CHI '18· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 100%
探索技术在提升视力丧失者生活质量方面的机遇
CHI '19· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 100%
LightWrite:使用智能手机教授盲人手写
CHI '21· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 100%
触觉凝视:视障人士探索凸起线条图形的行为标志
CHI '21· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 100%
使用自然声音的可访问数据表示
CHI '23· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 100%
ImageAssist: 增强盲人和低视力用户基于触摸屏的图像探索系统的工具
CHI '23· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 100%
解释什么是树状图:探索性调查向盲人和低视力用户解释不熟悉的图表的策略
CHI '23· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642632
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
work
职业/产业
残障服务提供者、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文