MUD:面向大规模和噪声过滤的现代风格UI建模UI数据集
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作软件工程师与开发者UI/UX 设计师AI/ML 研究员与工程师
文献标题
MUD: Towards a Large-Scale and Noise-Filtered UI Dataset for Modern Style UI Modeling
文献信息
- 主题领域: 人机交互(Human-Computer Interaction,HCI)领域中的移动用户界面(UI)研究
- 关键词: 数据集, UI建模, 大语言模型, 移动用户界面, 噪声过滤, 自动化探索, 用户界面检索, 元素检测
研究背景与问题
-
问题与挑战:
- 移动UI建模需要高质量的数据集,但现有数据集往往过时(如Rico数据集自2017年以来未更新)、噪声数据较多(例如不准确的视图层次结构)且无法满足现代UI的要求。
- 噪声包括部分渲染的UI、叠加的视图层次以及重复的屏幕,有可能降低数据驱动UI建模的性能。
- 模型基于过时的UI训练,导致在面对现代设计时性能下降。
-
重要性:
- 移动应用越来越重要,UI建模涉及多个任务(如界面元素检测、屏幕嵌入、控件标签生成、设计搜索等)。
- 高质量、现代风格UI数据集的缺乏限制了上述任务的发展。
-
研究动机与相关工作:
- 现有数据集(如Rico)的设计风格已过时,噪声问题显著,数据驱动建模的性能受到影响。
- 大语言模型(LLM)的语义理解能力为自动化应用探索提供了新的可能性。
- 需要一套包含现代风格UI、具备高质量视图层次结构且消除噪声的移动UI数据集。
解决方案
-
提出的方法:
- 采用一种全新的大语言模型(LLM)增强的自动化应用探索方法,将应用探索视为问答任务,通过LLM模拟人为探索移动应用。
- 使用成熟的技术和最佳实践过滤噪声数据,包括基于视图层次数据的重复检测与深度学习方法检测叠加视图层次。
- 在自动化过滤后,人工验证用于确保数据集的最终质量。
-
创新点:
- 首次将LLM应用于移动应用的探索,并模拟人类专家行为来触发更大范围的UI。
- 结合去噪技术和人工验证,显著提高了数据集的质量。
- 收集了基于最近流行应用的高质量、现代风格的移动UI数据集。
-
实施步骤与技术:
- 应用收集: 开发基于云的网页爬虫,从Google Play商店获取热门应用。
- 自动化探索: 利用LLM生成用户交互脚本,通过Android工具(如ADB、UIAutomator)执行操作。
- 噪声验证与过滤:
- 使用MD5哈希方法去除重复数据。
- 基于深度学习模型过滤叠加视图层次。
- 人工审核确保数据质量。
- 数据分析与发布: 收集18,000个UI,每个UI包含屏幕截图和高质量视图层次结构。
研究成果
-
具体成果:
- 构建了MUD数据集,包含18,132个独特的UI屏幕,来自3,300个安卓应用(覆盖33个应用类别)。
- 数据集用于两个任务:UI元素检测和UI检索。
- 实验结果表明,MUD比现有数据集(如Rico)更具现代性和质量优势。
-
优势:
- 自动化探索覆盖率比现有三个工具(Monkey, Droidbot, Humanoid)高17%,探索全面性显著提升。
- 在UI元素检测中,MUD相比Rico提高了10.5%的平均检测精度(AP),尤其对于现代UI元素表现更优。
- 在UI检索任务中,MUD的相关性评分为4.1(满分5),远高于Rico的3.2评分。
-
实验与评估结果:
- LLM增强的探索方法在应用覆盖率、有效文本输入、复合操作生成、多语言支持等方面展现了较高能力。
- 数据集中的UI质量经过滤噪和人工验证,最终保留近40%最优数据。
- 实验表明,MUD在两个下游任务中显著超越Rico数据集。
-
局限性与未来方向:
-
局限性:
- 当前数据集仅包含安卓应用,不包括iOS和网页应用数据。
- 屏幕截图和视图层次结构覆盖不足,缺乏交互跟踪、多模态信息(如动画)。
- LLM探索排除了复杂的账号注册流程。
-
未来方向:
- 扩展至其他平台(如iOS、网页),构建多模态移动UI数据集。
- 改进LLM模型以利用更多上下文信息(如应用描述和交互历史)提高探索效率。
- 设计完整的账号注册/登录解决方案,突破现有探索工具的限制。
- 将数据集扩展到更多模型任务(如屏幕问答、屏幕摘要生成)以进一步验证其广泛适用性。
-
总结
本文提出了一种创新的自动化方法,旨在解决现有UI数据集的过时与噪声问题,并构建了18,000+个现代风格UI的MUD数据集。实验验证了方法的优势与数据集的有效性,为UI建模研究开辟了新路径。数据集已公开发布,为推动高质量UI设计研究奠定了基础。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何通过大语言模型(LLM)增强的自动探索方法实现更高质量和现代风格的移动UI数据集?分类: GUI/IoT 任务自动化与界面生成同类问题arrow_forward
- 哪些噪声过滤技术能有效提高UI数据集的质量,同时保留重要信息?分类: GUI/IoT 任务自动化与界面生成同类问题arrow_forward
- 改进后的数据集在UI元素检测和UI检索等任务中的表现如何,相较于现有数据集有何提升?分类: GUI/IoT 任务自动化与界面生成同类问题arrow_forward
lightbulb
现实痛点
1- 现有移动UI数据集缺乏现代风格且存在大量噪声,影响建模精度。分类: GUI/IoT 任务自动化与界面生成同类问题arrow_forward
- 100%
生成式AI的角色如何影响人机协作工作中价值感知
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 83%
ReactGenie:使用大型语言模型开发复杂多模式交互的框架
CHI '24· 语音用户界面(VUI)设计 +2
- 83%
AI增强的头脑风暴:研究LLM在团队创意生成中的应用
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 83%
知识工作中的人工智能生成技术:数据导航和决策制定的设计影响
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 83%
超越代码生成:LLM支持的程序设计空间探索
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 83%
CARING-AI:通过生成式人工智能实现上下文感知的增强现实指令创作
CHI '25· AR 导航与情境感知 +2
- 83%
使用提示进行原型设计:协作软件团队在生成式AI设计中的新兴方法和挑战
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 83%
创建设计资源以支持AI概念的构思
DIS '23· 生成式AI(文本、图像、音乐、视频) +2
- 83%
GPTVoiceTasker:通过动态界面探索与学习提升多步骤移动任务效率
UIST '24· 生成式AI(文本、图像、音乐、视频) +2
- 80%
使用生成语言模型发现自然语言编程的语法和策略
CHI '22· 生成式AI(文本、图像、音乐、视频) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642350
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
软件工程师与开发者、UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文