文献标题

Making Short-Form Videos Accessible with Hierarchical Video Summaries

文献信息

  • 主题领域: 辅助技术与人机交互,主要关注短视频的无障碍性
  • 关键词: 短视频, 无障碍, 视频描述, 层级化摘要, 社交媒体, 盲人用户, GPT-4, 视频可视化

研究背景与问题

  • 问题或挑战:

    • 短视频(如 TikTok、Instagram Reels 和 YouTube Shorts)已成为主要的信息与娱乐来源,但对盲人和低视力(BLV)观众而言,大量短视频由于视觉转场快、屏幕文字信息密集以及背景音乐或模因音频覆盖而不具可访问性。
    • 现有的视频描述手段(例如嵌入音频描述或手动添加描述文本)在短视频中存在局限性,难以在快速切换的内容中提供适当的时间同步信息。
    • 盲人用户需要可靠的方式来提前判定视频的可访问性或选择是否观看,这在短视频平台中更大挑战。
  • 重要性:

    • 提高短视频对 BLV 用户的无障碍性有助于增强其对主流媒介的访问权,同时促进社会包容性。
    • 更高质量的描述系统可填补现有的技术空白,为研究人机交互提供启示。
  • 研究动机与相关工作:

    • 过去的研究探索了长视频中的无障碍音频描述,但在短视频领域几乎空白。
    • 层级化视频摘要方法尚未在短视频无障碍应用中被系统化验证。
    • 社交媒体平台对盲人用户的支持非常有限,用户往往依赖朋友或在线社区补充描述信息,但这些方法耗时且效率低下。

解决方案

  • 方法或解决方案:

    1. 系统设计: 开发了一个名为 ShortScribe 的系统,为 BLV 用户提供短视频的层级化视频摘要。
    2. 层级摘要: 包括:
      • 简短描述:10字以内的概要描述,帮助用户快速了解视频内容。
      • 详细描述:更长的摘要提供更多语义细节。
      • 逐镜头描述:按视频片段分解的逐步详细总结。
      • 屏幕文字提取:对视频中出现的文字内容进行光学字符识别(OCR)。
    3. 技术策略:
      • 使用 Google Cloud 的 ASR 自动转录视频音频。
      • 使用场景检测(FFMPEG)分割视频。
      • 应用 BLIP-2 模型生成视觉描述,再结合大语言模型 GPT-4 对数据进行抽象和整合。
  • 创新之处:

    • 提出了一种层级式的视频摘要结构,使用户可以按需访问详细程度不同的描述信息。
    • 利用多模态方法提取和集成视频的视觉、音频和操作信息。
    • 通过引入 GPT-4 的摘要能力,进一步提高视频描述的生成质量。
  • 实施步骤:

    1. 数据处理管道:
      • 视频分割为多个镜头,每个镜头计算关键帧。
      • 提取文字(OCR)、生成视觉描述(BLIP-2)和音频转录。
    2. 描述生成与优化:
      • GPT-4 生成灵活摘要,包括短描述、长描述及逐镜头摘要。
      • 聚合多模态信息(视觉、音频、屏幕文字)确保描述的语义覆盖性和信息准确性。
    3. 界面设计:
      • 两级界面结构:视频播放器层级(显示简短描述)与描述访问层级。
      • 设计友好的屏幕阅读器支持功能。

研究成果

  • 具体成果:

    1. ShortScribe 显著提升 BLV 用户对短视频的理解能力:
      • 用户对视频的理解评分从基线系统的 2.53 提升至 ShortScribe 的 5.89(满分 7)。
      • 用户的视频内容总结准确率从基线的 20% 提升至 73%。
    2. 通过用户测试观察到 BLV 用户对不同层级的描述有具体用途偏好(如“简短描述”适合快速浏览,“长描述”支持深入理解)。
    3. 提供的描述覆盖率达到 75%(简短描述)到 100%(长描述和逐镜头描述)。
  • 比较优势:

    • 相比于现有描述技术,ShortScribe 允许用户灵活选择适当的信息层级,节省时间并提升兴趣视频选择的效率。
    • 使用大语言模型整合各模态的数据,描述性能更优且支持性更高。
  • 实验或评估结果:

    • 在任务设置的用户研究中,受试者(N=10)明确表示 ShortScribe 改善了短视频的观看体验。
    • 技术评估显示大部分描述无显著误差(短描述错误率为 33%,长描述错误率为 57%),但存在一些模型误判案例(如对情绪的误判)。
  • 局限性与未来方向:

    • 局限性:
      1. 某些复杂视觉动作(如舞蹈)或交互视频(如反应视频)未有效支持。
      2. 模型生成的描述中仍存在错误,影响部分视频的准确理解。
      3. 描述系统的冗余信息(如重复内容)可能影响用户体验。
    • 未来方向:
      • 改进视觉至语言模型的准确性(如采用改进后的 GPT-V 或 Google Bard)。
      • 探索个性化的描述生成机制(如用户自定义摘要中的优先事项)。
      • 对复杂数据生成优化支持(如 3D 动作重建、多层视频描述)。
      • 扩展至长视频、直播视频及全景视频等应用场景。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/148297/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642839
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文