学习去噪原始移动UI布局以大规模改进数据集
原型设计与用户测试计算方法在HCI中的应用软件工程师与开发者UI/UX 设计师
文献标题
Learning to Denoise Raw Mobile UI Layouts for Improving Datasets at Scale
文献信息
- 主题领域: 移动用户界面(UI)布局数据的清理与分类
- 关键词: 数据集, 神经网络, 移动UI布局, 图神经网络, Transformer, 卷积神经网络
研究背景与问题
-
现有问题或挑战:
- 移动屏幕UI布局数据常常不完善:包括无效对象的存在、布局与屏幕截图不一致、或使用过于通用或特定的类型(如
View或ColombiaNativeAdView)。 - 这些问题导致布局数据在分析与建模过程中难以被利用,甚至可能降低模型性能。
- 传统通过人工方法清理布局数据的方式效率低下且成本高昂。
- 移动屏幕UI布局数据常常不完善:包括无效对象的存在、布局与屏幕截图不一致、或使用过于通用或特定的类型(如
-
研究重要性:
- UI布局是UI设计研究与语义理解的重要数据来源,清理与改进布局数据对于推动相关工作具有重要意义。同时可以通过提高数据质量增强任务性能(如屏幕总结和组件检测)。
-
研究动机与相关工作:
- 之前学者尝试使用启发式规则或人工标注来解决上述问题,但这些方法存在扩展性差和花费高的问题。
- 尝试用深度学习方法自动清理布局数据仍在早期阶段。
- 该研究希望用深度学习方法实现自动化、高效地修正与统一布局数据,同时创建一个标准化的大规模数据集。
解决方案
-
提出的方法和解决方案:
- 提出名为“CLAY”的两阶段管道(Pipeline),利用深度学习模型实现布局数据的清理。
- 无效对象检测(Invalid Object Detection)模块:去除与屏幕截图不匹配的对象。
- 对象类型识别(Object Type Recognition)模块:为每个有效对象赋予一个语义明确的类型。
- 提出名为“CLAY”的两阶段管道(Pipeline),利用深度学习模型实现布局数据的清理。
-
创新之处:
- 使用基于深度学习的自动化方法替代人工清理,减少成本且具备大规模应用的潜力。
- 提出了结合图神经网络(GNN)和Transformer的对象类型识别方法,用于更好地捕获对象间的关系和特征。
- 创建了一个质量更高的移动UI布局数据集"CLAY",包含 59,555 个带人类标注的屏幕布局。
-
实施步骤与关键技术:
- 无效对象检测:
- 使用ResNet-50卷积神经网络模型,结合一个掩码通道来区分待检测对象,用于二分类。
- 对象类型识别:
- 分别基于图神经网络和Transformer设计了两种模型。
- 图神经网络方法通过消息传递机制利用视图层次结构的树状关系,并结合像素、文本和位置信息。
- Transformer方法采用基于图像编码的Transformer并应用自注意力机制建模对象之间的关系。
- 数据和标注:
- 清理和标注Rico数据集,过滤出 59,555 个布局,标记为有效或无效,并为每个有效对象定义了语义类型。
- 无效对象检测:
研究成果
-
具体成果:
- 提出了CLAY管道实现自动化清理与分类。
- 生成了包含 59,555 个屏幕布局的高质量数据集CLAY,这些布局中的无效对象被标记,且有效对象每个都获得了语义明确的类型。
- 模型性能:
- 无效对象检测模块达到82.7%的F1分数。
- 对象类型识别模块两种实现(GNN和Transformer)的F1分数分别为85.9%和84.7%。
- 新方法显著优于启发式基准。
-
对比分析与优势:
- GNN模型对常见类型更敏感,但Transformer在处理稀有类别时表现更佳。
- 相比启发式方法,深度学习方法更灵活,对不同类型具有更强的泛化能力。
-
实验或评估结果:
- 模型对稀有对象与复杂布局具有一定的鲁棒性。
- 错误分析表明,主要错误来源于对象的边界偏差、重叠区域或数据的不平衡。
-
局限性与未来方向:
- 模型训练与评估仅基于Android截图,尚未在其他平台(如iOS)数据上验证。
- 面对某些复杂清理任务(如添加缺失对象或修改属性)功能仍显不足。
- 未来改进方向包括混合模型架构、引入整个图像上下文的信息以及构建跨平台数据集。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何自动化地清理和标准化手机屏幕的UI布局数据?分类: 场景化速写理解与识别同类问题arrow_forward
- 深度学习方法在识别无效对象和分配语义类型方面的表现如何?分类: 场景化速写理解与识别同类问题arrow_forward
- 使用图神经网络和Transformer模型能否提升UI布局数据清理的效果?分类: 场景化速写理解与识别同类问题arrow_forward
lightbulb
现实痛点
1- 移动端UI布局数据中常存在无效对象和语义不一致,影响任务性能。分类: 场景化速写理解与识别同类问题arrow_forward
- 100%
Varv:作为声明性数据结构的可重新编程交互软件
CHI '22· 原型设计与用户测试 +1
- 100%
如何绘制命令?一项关于电子表格草图的诱发研究
CHI '25· 原型设计与用户测试 +1
- 100%
从具有多模态和位置属性的异构网络学习用户界面语义
IUI '22· 原型设计与用户测试 +1
- 80%
引导式错误粉碎:通过提示操作协助Android应用的手动GUI测试
CHI '22· 开源协作与代码审查 +2
- 75%
通过容错延迟控制性能
CHI '19· 原型设计与用户测试 +1
- 75%
KeyMap:使用诺曼的映射改进键盘快捷方式词汇
CHI '20· 原型设计与用户测试
- 75%
X-Droid:具有单一应用幻象的快速便捷Android原型开发框架
UIST '19· 原型设计与用户测试
- 67%
探索数据驱动产品设计的未来
CHI '20· 知识工作者工具与工作流 +2
- 67%
Screen2Vec: GUI屏幕和GUI组件的语义嵌入
CHI '21· 可解释人工智能(XAI) +2
- 67%
Belidor:一种用于操作化用户界面结构类比的操作规范语言
CHI '26· 参与式设计(Participatory Design) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3502042
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
原型设计与用户测试、计算方法在HCI中的应用
work
职业/产业
软件工程师与开发者、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文