WebUI:一个利用网络语义增强视觉UI理解的数据集

荣誉提名
通用设计与包容性设计原型设计与用户测试计算方法在HCI中的应用软件工程师与开发者辅助技术专家HCI 研究员

文献标题

WebUI: A Dataset for Enhancing Visual UI Understanding with Web Semantics

文献信息

  • 主题领域: 用户界面(UI)建模、计算机视觉、迁移学习
  • 关键词: 数据集, UI建模, 计算机视觉, 迁移学习, 网络语义, 人机交互

研究背景与问题

  • 作者发现了哪些问题或挑战?
    • 当前用于用户界面建模(UI modeling)的数据集规模有限,主要依赖人工爬取和标注,这一过程成本高昂且耗时。
    • 现有的UI数据集(如Rico、Enrico)通常已过时,缺乏更新,导致它们可能不能很好地适配最新的设计规范。
    • 数据集中常见的设备依赖性使得跨平台的迁移学习变得更加困难。
  • 为什么这个问题很重要?
    • 用户界面建模在无障碍设计、自动化和软件测试等领域中具有重要意义。扩大数据集规模和质量可以提高机器学习模型的性能,帮助更好地理解和操作UI。
    • 数据稀缺限制了计算机视觉模型在UI理解方面的推进。
  • 研究动机与相关工作
    • 作者借鉴了现有的UI数据集(如AMP、Rico)及其应用,同时认识到这些数据集的局限性(如噪声、多样性不足)。
    • 针对Web作为UI数据来源的潜力,Webzeitgeist等工作证明了自动化收集Web页面的可行性。
    • 作者希望利用Web的可访问性和丰富的语义信息,构建一个更大、更通用的UI数据集。

解决方案

  • 作者提出了哪些方法或解决方案?
    • 构建了一种名为WebUI的全新数据集,它包含了从约40万个Web页面中自动采集的截图及其关联的语义和样式元数据。
    • 运用了多种迁移学习方法(如微调、半监督学习、无监督域适配)将WebUI的数据应用到移动端UI场景。
  • 该解决方案的创新之处是什么?
    • 数据集规模远超以往,是现有公开数据集的数量级提升。
    • 自动化爬取和标注流程显著降低了数据生成的成本(3个月内仅花费约500美元)。
    • 数据集中每个页面包含多个设备模拟的视图,并结合了访问性树和计算样式等语义信息,支持通用UI建模。
  • 实施步骤是什么?使用了哪些关键技术?
    1. 数据集收集:
      • 使用云端并行爬虫,包含头less浏览器(如Chrome)实现自动化网页访问和元数据提取。
      • 模拟6种常见设备(包括手机、平板、不同分辨率台式机)来生成多视图数据。
    2. 数据分析与质量评估:
      • 定量分析了Web页面的元素大小、遮挡率和响应式布局。
      • 发现页面布局、点击元素等大多数指标达到了UI建模的基本需求。
    3. 迁移学习实践:
      • 微调(Fine-tuning):通过WebUI数据预训练模型,然后在较小的目标数据集(如移动端数据)上微调。
      • 半监督学习(Self-training):利用WebUI的伪标签增强移动UI分类模型。
      • 无监督域适配(UDA):借助域对抗网络,使模型在无目标域标注的情况下提升跨平台性能。

研究成果

  • 取得了哪些具体成果?
    • 发布了一个规模达40万页面的数据集WebUI。
    • 数据集自动化收集成本较低,但几何信息、元数据语义质量都支持视觉建模。
    • 显示基于Web数据的预训练策略在多个任务中的有效性。
  • 与现有解决方案相比,它有哪些优势?
    • 规模:比现有最大的Rico数据集大一个数量级。
    • 更新性:易于通过重新爬取来获取最新的设计样式。
    • 多功能性:涵盖丰富的语义和样式信息,适用于多种UI理解任务。
  • 实验或评估结果是什么?
    • 元素检测:通过WebUI数据预训练的模型在VINS任务上实现了高达14%的性能提升(mAP从0.67到0.81)。
    • 屏幕分类:利用半监督学习结合WebUI数据可使分类准确率提升5%。
    • 屏幕相似性:在无标注数据情况下,通过无监督域适配,模型在视频片段分割任务中展现优异性能。
  • 局限性与未来方向
    • 数据噪声:自动化生成的标注数据可能存在错误(如元素尺寸过小、遮挡问题等)。
    • 泛化能力:目前的研究主要用于静态UI数据,不适合动态交互建模。
    • 深网覆盖不足:爬虫无法访问需要身份验证或JavaScript动态生成的页面。
    • 未来方向:
      • 借助用户交互示踪支持更复杂的动态建模。
      • 改进爬虫以挖掘深网内容,提高数据集覆盖率。
      • 结合更多下游任务(如自动化交互行为模拟、基于设计目标的验证)。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/96112/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581158
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
荣誉提名
group
作者
6 位作者
sell
研究子方向
通用设计与包容性设计、原型设计与用户测试、计算方法在HCI中的应用
work
职业/产业
软件工程师与开发者、辅助技术专家、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文