Ga11y: 一个为视觉障碍用户自动注解GIF的系统

视觉障碍者技术(屏幕阅读器、触觉图形、盲文)辅助技术专家

文献标题

Ga11y: An Automated GIF Annotation System for Visually Impaired Users

文献信息

  • 主题领域: 人机交互,辅助技术,无障碍设计
  • 关键词: GIF, 图像描述, 盲人, 弱视, 文本描述, 人力标注, 众包, 无障碍

研究背景与问题

  • 问题与挑战: 动态 GIF 图像在互联网和社交媒体中大量应用,但很少附带文本描述,导致盲人或弱视(BLV)用户难以获得这些图像的含义。现有的计算机视觉技术在描述动态且多义性的 GIF 内容方面具有局限性。
  • 重要性: GIF 是一种包含丰富情绪表达和文化背景的信息载体,对 BLV 用户而言,这些不可达的信息妨碍了他们与他人平等地参与在线交流。
  • 研究动机与相关工作: 此前,针对静态图像的许多努力已经取得了成果,例如通过替代文字(alt text)描述图像内容。然而,动态 GIF 的标注仍是一项极具挑战的问题,现有的研究和工业实践在帮助 BLV 用户理解 GIF 的内容方面成效有限。

解决方案

  • 方法或解决方案: 本研究提出了 Ga11y 系统,这是一个结合机器智能和众包的 GIF 自动标注系统。
  • 创新之处:
    • 集成 Android 客户端、后端服务器和基于 Web 的人力标注界面。
    • 采用类似“半结构化模板” 的标注任务设计,显著提高标注质量。
    • 实现了支持用户交互的 GIF 重建和相似性匹配算法。
  • 实施步骤与关键技术:
    1. 开发 Android 客户端,监测用户屏幕上的 GIF 元素,提供请求标注的互动接口,并记录屏幕 GIF。
    2. 服务器解析、存储关键帧并匹配数据库中的 GIF。
    3. 若数据库中无相似 GIF,则用计算机视觉服务(Google Vision, Microsoft Azure)生成机器标注。
    4. 提供一个 Web 平台,让志愿者根据 GIF 内容撰写详细的人力标注。
    5. 标注采用半结构化任务设计:结合自由表达和有指导的提示提升标注质量。
    6. 将描述同步到服务器以支持未来快速匹配。

研究成果

  • 具体成果:
    • Ga11y 系统实现了动态 GIF 的高效标注,BLV 用户可以通过 Android 客户端听取文本描述。
    • 系统用户体验得分(SUS)高达 89.1/100,用户认为其“高度易用”。
    • 机器学习生成的文本虽然基础,但为未标注 GIF 提供了及时的初步信息,人力标注提供了更丰富和高质量的描述。
  • 与现有解决方案的优势:
    • 集成了人力与机器智能,可持续更新标注数据库。
    • 半结构化标注风格被用户认为比自由形式和结构化描述更清晰、信息更丰富。
    • 开放源码,支持进一步开发扩展。
  • 实验与评估结果:
    • 通过两阶段用户研究和超过 12 名参与者的测试,系统在提高 BLV 用户在线交流质量方面表现出色。
    • 在 3 天实际使用中,共处理了 548 个标注请求,验证了该系统的高频使用潜力。
  • 局限性与未来方向:
    • 标注过于详细的问题需要改进,例如允许用户调整描述的细节级别。
    • 当前数据处理涉及隐私问题,未来可以改进为本地化存储与识别。
    • 用户期望支持更多语言和平台(如 iOS)。
    • 用户长期使用数据的采集分析仍需进一步验证,包括更加多样化和全球化的用户群体测试。

总结

Ga11y 通过结合机器学习和人力协作,解决了动态 GIF 标注存在的技术和交互性难题。本研究支持 BLV 用户更好地理解并参与互联网文化,并为 GIF 平台的未来开发提供了关键性技术参考。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/69035/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3502092
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
work
职业/产业
辅助技术专家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文