VisionTasker:基于视觉UI理解与LLM任务规划的移动端任务自动化
移动任务自动化是一个新兴领域,利用AI简化和优化移动设备上常规任务的执行,从而提高效率和生产力。传统方法(如编程演示PBD)因依赖预定义任务且易受应用更新影响而存在局限性。最近的研究利用视图层级收集UI信息并采用大语言模型(LLM)增强任务自动化。然而,视图层级存在可访问性问题,可能出现对象描述缺失或结构错位等问题。本文提出VisionTasker,一个结合基于视觉的UI理解和LLM任务规划的两阶段框架,用于逐步执行移动任务自动化。VisionTasker首先使用基于视觉的UI理解方法将UI截图转换为自然语言描述,从而无需视图层级。其次,它采用逐步任务规划方法,一次向LLM呈现一个界面,然后识别相关元素并确定下一步操作,从而提高准确性和实用性。大量实验表明,VisionTasker优于先前方法,在四个数据集上提供有效的UI表示。此外,在Android智能手机上自动化147个真实世界任务时,VisionTasker在人类不熟悉的任务中表现出优势,并与PBD机制集成时显示出显著改进。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 83%
"如果机器和我一样好,那我还有什么用?" – 使用ChatGPT如何改变年轻专业人士对生产力和成就的看法
CHI '24· 大语言模型(LLM)的人机协作 +1
- 83%
「这对我也会有效」:在线社区如何影响软件开发人员对AI驱动的代码生成工具的信任
IUI '25· 大语言模型(LLM)的人机协作 +1
- 83%
基于 Ply 的生成式触发-动作编程
UIST '25· 大语言模型(LLM)的人机协作 +1
- 71%
基于模型的强化学习适应用户界面
CHI '21· 大语言模型(LLM)的人机协作 +2
- 71%
ChainBuddy:一种用于生成LLM管道的人工智能辅助代理系统
CHI '25· 大语言模型(LLM)的人机协作 +1
- 71%
辅助还是干扰?探讨和评估主动AI编程支持的设计和权衡
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
PointAloud:AI支持的指针中心发声计算交互套件
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
情境化、动态化与主观化:与行业从业者共同构想心智理论赋能的日常AI设计
CHI '26· 脑机接口(BCI)与神经反馈 +2
- 71%
陈述你的意图以牵引你的注意力:用于有意数字生活的AI助手
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
ChoiceMates:通过多代理对话交互支持不熟悉的在线决策
IUI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)