用户界面的终身学习
作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统自动机器学习(AutoML)界面软件工程师与开发者AI/ML 研究员与工程师HCI 研究员
文献标题
Never-ending Learning of User Interfaces
文献信息
- 主题领域: 人机交互与机器学习模型在用户界面自动化中的应用
- 关键词: 用户界面, UI建模, 机器学习, 应用爬虫, 持续学习
研究背景与问题
- 发现的问题或挑战:
- 当前许多机器学习模型依赖人工标注的静态截图数据集,采集成本高且容易出错。尤其是诸如判断 UI 元素是否可点击(tappable)等任务时,人工标注容易产生不确定性。
- 传统数据集无法反映应用程序动态更新后的真实场景。
- 重要性:
- 自动化获取UI语义数据并持续更新模型,有助于提高应用程序的可访问性、测试效率以及自动化程度,从而更好地支持用户。
- 研究动机与相关工作:
- 现有数据集如 Rico 和 AMP 提供了大规模移动 UI 数据,但大多通过人工交互或静态分析生成。
- 持续学习(Never-ending Learning)被首次应用于知识抽取,有可能拓展到 UI建模领域以解决动态数据收集问题。
解决方案
- 提出的方法或解决方案:
- 构建一个自动化爬虫系统——Never-ending UI Learner,从移动应用商店中安装真实应用,通过交互发现UI元素的语义属性,生成标注数据,并不断更新机器学习模型。
- 创新之处:
- 完全自动化的数据收集与标注,无需人工监督。
- 爬虫能动态适应应用的更新和设计趋势。
- 初次使用人工标注数据训练模型后,可通过新的交互数据完全替代人工标注。
- 实施步骤与关键技术:
- 系统架构:
- 爬虫的协调服务器管理应用列表并分发到多个工作节点。
- 工作节点在移动设备上自动安装应用,进行交互,并生成数据。
- 数据处理与模型设计:
- 通过爬虫记录交互的时间序列截图,以启发式方式标注交互结果,如可点击性(tappability)和可拖动性(draggability)。
- 使用深度神经网络模型预测 UI 元素语义,包括两个主要组件:
- 基于 CNN 的屏幕相似性模型。
- UI 元素检测和语义预测模型(如 tappability 和 draggability)。
- 系统架构:
研究成果
- 具体成果:
- 爬虫系统累计运行超过5000小时,在6461个应用上执行了超过50万次操作,生成了比现有数据集规模更大的标注数据。
- 成功训练了三个 UI 语义模型:
- Tappability:预测元素是否可点击,最终 F1 分数达到0.860。
- Draggability:预测元素是否可拖动,最终 F1 分数达到0.794。
- Screen Similarity:预测页面的相似性,最终 F1 分数达到0.663。
- 与现有解决方案对比优势:
- 显著降低人工标注成本,同时提高数据标注的可靠性。
- 面向实际应用场景动态设计变化的更强适应性。
- 实验与评估结果:
- 对比随机爬取与不确定性采样,随机爬取策略达到最佳性能。
- 各模型均在早期训练阶段快速提高性能,但在后续爬取周期性能改进趋于平缓。
- 通过爬虫生成的数据对屏幕相似性模型进行微调,达到了比原始数据集仅训练更好的结果。
- 局限性与未来方向:
- 系统目前仅支持 iOS 应用的爬取与分析,未来可扩展至其他平台(如 Android 和 Web)。
- 交互标注的启发式方法对某些复杂语义可能无法有效泛化。
- 需要改进数据冗余问题的处理(如重复爬取相似场景)。
- 探索更多UI语义的学习方法,如“按住”功能或文本框输入行为。
总结
本研究实现了基于自动化交互的持续学习框架,用于动态收集和建模用户界面语义数据,具有高度的自动化和可扩展性。该方法不仅有效降低了人工标注的成本,还能够学习和适应不断演化的 UI 设计趋势,未来有望在提高应用可访问性、自动化测试以及 UI 可用性改进方面产生重要影响。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何实现基于自动交互的用户界面语义数据的持续学习?分类: 人机协同标注与示例选择同类问题arrow_forward
- 自动数据爬取系统如何解决传统数据集动态更新不匹配的问题?分类: 人机协同标注与示例选择同类问题arrow_forward
- 如何保证UI语义模型在动态变化中的准确性和适配性?分类: 人机协同标注与示例选择同类问题arrow_forward
lightbulb
现实痛点
1- UI语义标注昂贵且易出错,难以满足动态应用需求。分类: 人机协同标注与示例选择同类问题arrow_forward
- 86%
当帮助变成伤害:AI编码助手的验证负荷与疲劳
CHI '26· 大语言模型(LLM)的人机协作 +3
- 83%
胜任但僵化:识别赋予AI平等参与群体决策能力的差距
CHI '23· 大语言模型(LLM)的人机协作 +1
- 83%
为什么约翰尼不能提示:非AI专家如何尝试(并失败)设计LLM提示
CHI '23· 大语言模型(LLM)的人机协作 +1
- 83%
从大规模交互痕迹中自动挖掘宏命令
CHI '24· 大语言模型(LLM)的人机协作 +1
- 83%
模型中的精灵:面向移动应用的人环深度神经网络自动生成
UbiComp '23· 大语言模型(LLM)的人机协作 +2
- 71%
Stack Overflow 过时了吗?对 ChatGPT 回答 Stack Overflow 问题特征的经验研究
CHI '24· 大语言模型(LLM)的人机协作 +2
- 71%
看不见的破坏者:谄媚型大语言模型在问题解决任务中误导新手
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
响应延迟和任务类型对人类-LLM 交互与感知的影响
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
氛围编程的纠缠——重新定位生成式 AI 编程中意图、作者身份与责任的边界
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
与我共编还是为我编程?AI 自动化程度提升如何改变开发者工作流
CHI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3586183.3606824
一眼看懂
fact_check论文快照
dataset
来源
UIST
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、自动机器学习(AutoML)界面
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文