VisionTasker:基于视觉UI理解与LLM任务规划的移动端任务自动化

大语言模型(LLM)的人机协作AI 辅助决策与自动化系统环境感知与上下文计算软件工程师与开发者UI/UX 设计师AI/ML 研究员与工程师

移动任务自动化是一个新兴领域,利用AI简化和优化移动设备上常规任务的执行,从而提高效率和生产力。传统方法(如编程演示PBD)因依赖预定义任务且易受应用更新影响而存在局限性。最近的研究利用视图层级收集UI信息并采用大语言模型(LLM)增强任务自动化。然而,视图层级存在可访问性问题,可能出现对象描述缺失或结构错位等问题。本文提出VisionTasker,一个结合基于视觉的UI理解和LLM任务规划的两阶段框架,用于逐步执行移动任务自动化。VisionTasker首先使用基于视觉的UI理解方法将UI截图转换为自然语言描述,从而无需视图层级。其次,它采用逐步任务规划方法,一次向LLM呈现一个界面,然后识别相关元素并确定下一步操作,从而提高准确性和实用性。大量实验表明,VisionTasker优于先前方法,在四个数据集上提供有效的UI表示。此外,在Android智能手机上自动化147个真实世界任务时,VisionTasker在人类不熟悉的任务中表现出优势,并与PBD机制集成时显示出显著改进。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/170816/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3654777.3676386
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、环境感知与上下文计算
work
职业/产业
软件工程师与开发者、UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文