VideoA11y:可访问视频描述的方法和数据集
作者
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)公共交通运营者医生、护士、临床医生辅助技术专家
研究背景与问题
- 发现的问题与挑战: 当前的人工智能模型在为盲人或低视力(BLV)用户生成视频描述时,因训练数据标注质量欠佳而效果不佳。这导致描述不能满全面满足BLV用户的需求。此外,人类生成的描述常不完整或包含语法、拼写或语义错误。
- 重要性: 视频内容的快速增长进一步拉大了BLV人群获取信息的鸿沟,尽管音频描述(AD)可以满足这些需求,但其制作需要昂贵的专业团队,尤其在用户生成内容(例如YouTube和TikTok)中,这类音频描述极少且落后于需求。
- 研究动机与相关工作: 以往研究多集中于辅助人类描述者生成描述,而完全自动化的方法尚未有效解决如何生成详尽且符合AD准则的视频描述的问题。此外,现有数据集的不足限制了AI生成描述的质量和可用性。
解决方案
- 提出的方法与创新性:
- 提出了一种新方法VideoA11y,结合多模态大型语言模型(MLLMs)与视频可访问性指导原则,设计符合规范的提示,生成高度清晰准确的视频描述。
- 基于此方法构建了一个包含40,000段视频的VideoA11y-40K数据集,这是目前最大、最全面的面向BLV用户的视频描述数据集。
- 实施步骤:
- 从专业音频描述资源中提取并整理42项AD准则,用于指导描述生成。
- 使用GPT-4 Vision(GPT-4V)等MLLM生成视频描述,同时整合视频关键帧数据。
- 构建并分类视频数据集VideoA11y-40K,将视频分为15个类别,每个视频均使用规范化提示生成描述。
- 使用的关键技术:
- 使用多模态语言模型(如GPT-4V和Video-LLaVA),进行零样本提示优化。
- 视频关键帧提取算法(基于局部最大算法),确保捕捉视频中显著变化。
- 数据集制备包括视频分类和严格的质量评估。
研究成果
- 具体成果:
- VideoA11y生成的描述在清晰度、准确性、客观性和描述性等方面均优于新手人类注解,与高质量人类注解表现接近。
- 构建的VideoA11y-40K数据集显著提升了多模态语言模型生成描述的质量,为视频可访问性提供了坚实的数据基础。
- 提出了一套新的基准标准,用于评估面向BLV用户的视频描述模型。
- 优势:
- VideoA11y生成的描述在准确性和清晰性方面超过了新手人类注解,且更接近专业人类注解。
- VideoA11y方法对现有模型具有显著的增强作用,同时降低了人为参与的依赖,具有较高可扩展性。
- 较少的幻觉现象(即模型生成不真实内容),尤其在人类注解作为参考时精准度显著提高。
- 实验和评估结果:
- 在5项用户研究中(包括347名视力正常用户、40名BLV用户及7名专业描述人员),VideoA11y总体表现优秀:
- BLV用户在90%以上的场景中更偏好VideoA11y生成的描述。
- 专业描述者更青睐VideoA11y生成的描述,认为其符合专业标准。
- 技术实验显示,使用VideoA11y-40K微调的开源MLLM模型,显著优于未微调的基线模型。
- 在5项用户研究中(包括347名视力正常用户、40名BLV用户及7名专业描述人员),VideoA11y总体表现优秀:
- 局限性与未来方向:
- 局限性:
- 无人类注解时,可能出现轻微幻觉现象(如引入视频中不存在的细节)。
- 当前方法无法满足BLV用户个性化需求(如对描述长度、细节程度的偏好)。
- 描述与视频内容无缝集成(如插入自然停顿点)尚未全面实现。
- 未来方向:
- 优化生成模型以减少幻觉场景,例如采用直接偏好优化(DPO)技术或整合辅助模型增强输入的精准性。
- 收集BLV用户偏好数据,实现动态调整描述风格和细节层次。
- 与现有系统(如Rescribe)集成,以支持描述的内嵌和视频流中的无缝呈现。
- 局限性:
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何结合多模态大语言模型与视频无障碍指南,提高AI生成的盲人或低视力用户视频描述的清晰度与准确性?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- 构建一个包含高质量视频描述的大型数据集(如VideoA11y-40K)能否显著提升现有多模态语言模型的表现?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- AI生成的视频描述是否能够比初学者生成的描述更贴合音频描述专业标准?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
lightbulb
现实痛点
1- 盲人难以高效获取视频内容信息,现有的音频描述稀少且成本高昂。分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- 75%
面向视障人士更易访问的科学PDF:逐步修复PDF以提高标签准确性
CHI '25· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 60%
ALAP:基于可访问LaTeX的数学文档创作与展示
CHI '19· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文) +1
- 60%
VIPBoard:通过字符级自动更正改进视障人士的屏幕阅读器键盘
CHI '19· 语音可访问性 +1
- 60%
Infosonics:使用声化和语音技术为盲人提供可访问的信息图表
CHI '22· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文) +1
- 60%
Toucha11y:使不可访问的公共触摸屏可访问
CHI '23· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文) +1
- 60%
个人资料图片的可访问性:超越Alt文本在线表达身份
CHI '23· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文) +1
- 60%
ChitChatGuide:利用大语言模型辅助视障人士探索购物中心的对话交互系统
MobileHCI '24· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714096
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
work
职业/产业
公共交通运营者、医生、护士、临床医生、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
7 篇相关论文