屏幕识别:从像素为移动应用程序创建可访问性元数据

最佳论文
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)通用设计与包容性设计辅助技术专家

文献标题

Screen Recognition: Creating Accessibility Metadata for Mobile Applications from Pixels

文献信息

  • 主题领域: 移动应用的无障碍设计与界面识别
  • 关键词: 移动无障碍性, 无障碍增强, UI检测, 像素识别, 屏幕阅读器, 自动元数据生成, 深度学习, 界面语义

研究背景与问题

  • 作者发现的问题或挑战:
    • 移动平台上很多无障碍功能(如屏幕阅读器)依赖开发者提供准确的用户界面(UI)元数据。然而,许多移动应用未能提供足够的无障碍元数据,导致这些功能无法正常工作。
    • 当前移动应用在无障碍性上的主要问题包括开发者缺乏认知、时间或资源限制,以及使用的第三方工具包无内置无障碍支持。
    • 大量现存的遗留内容和应用程序缺乏开发人员支持,这些应用可能在功能设计时未考虑无障碍性。
  • 研究的重要性:
    • 无障碍性是确保视力障碍用户使用数字工具的关键问题。
    • 研究解决如何自动生成无障碍元数据,从而提升现有应用和内容的可用性,对于用户和开发者都具有重要实际意义。
  • 研究动机与相关工作:
    • 之前的研究尝试通过教育、标准和工具提升开发者的无障碍设计水平,但收效有限。
    • 通过像素识别推断 UI 元素位置和语义是一种可行但未深入探索的方向,特别是在移动设备资源限制的情况下。

解决方案

  • 提出的方法或解决方案:
    • 提出了一种基于视觉界面像素的新方法,自动生成无障碍元数据。这种方法包括:
      1. 使用基于深度学习的对象检测模型从移动应用的屏幕截图像素中检测 UI 元素。
      2. 利用启发式规则和其他模型(如 OCR、内容分析)完善检测结果,生成语义信息。
    • 提出了“屏幕识别”功能,可以增强 iOS 的屏幕阅读器(VoiceOver)。
  • 创新之处:
    • 从像素入手检测 UI 元素并生成无障碍元数据,而非依赖应用开发者的支持。
    • 整合了对象检测、光学字符识别(OCR)、语义分组和界面交互性分析,为屏幕阅读器提供更完整的支持。
  • 实施步骤与技术:
    1. 数据收集: 收集了来自 4068 个 iPhone 应用的 77637 个屏幕,其 UI 元素由人工标注形成训练集。
    2. 模型训练: 开发了基于 SSD+MobileNet 的对象检测模型,针对移动设备优化了速度和内存效率。
    3. 后处理规则: 利用启发式算法处理模型输出,如补充缺失 UI 元素、去除冗余输出、排定导航顺序。
    4. 特定特性分析: 利用 iOS 的 OCR 和图片描述功能为图标/图片元素生成内容;构建分组和交互性分析模型,增强用户导航体验。

研究成果

  • 具体成果:
    • 数据集部分:
      • 收集并标注了 77,637 个屏幕,涵盖了 12 种主要 UI 元素类型,总计 1,544,929 条标注。
    • 模型性能:
      • UI 元素检测模型在测试集上取得了 71.3% 的平均精度 (mAP),在常用 UI 模型(如文本和图片)上达到较高的精确度。
      • 应用分组、排序和交互性分析后,用户导航的元素数量减少了 48.5%。
    • 用户评价:
      • 在与 9 名视障用户的研究中,用户体验显著提升,评分从原有 VoiceOver 的 2.08 提高到 3.73(满分 5 分)。
      • 用户认为“屏幕识别”帮助他们访问了以前无法使用的 UI 元素,并增强了屏幕布局的理解。
  • 与现有解决方案的优势:
    • 无需开发者主动参与即可增强现有应用的无障碍性。
    • 模型优化适用于设备端,能实时运行于实际移动应用中,不增加显著内存开销(仅 20MB)。
    • 自动生成比传统方法更全面的无障碍元数据,覆盖 UI 元素的类型、位置、内容、状态及交互性。
  • 实验/评估结果:
    • UI 元素检测模型有效性在用户实际操作中得以验证,尤其对缺乏无障碍支持的应用改进显著。
    • 分组和排序规则的准确性优异,准确率为 73.7%,并在大多数情况下实现了清晰、合理的屏幕元素导航。
  • 局限性与未来方向:
    • 屏幕识别在某些复杂界面上的性能偏低,尤其是在动态 UI 和状态变化检测方面。
    • 当前系统未能处理没有显式视觉提示的交互功能,例如在电子书阅读器中无法识别页面滑动操作。
    • 未来方向包括:
      • 跨平台扩展(如 Android 和桌面应用),以及改进模型以适应动态布局和设计变化。
      • 探索更高层次的 UI 语义分析,如通过集成 UI 树结构和像素信息生成更精准的元数据。
      • 将方法整合到开发者工具中,用于设计阶段的无障碍性检查和建议。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/47343/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445186
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
最佳论文
group
作者
12 位作者
sell
研究子方向
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)、通用设计与包容性设计
work
职业/产业
辅助技术专家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文