LlamaTouch:一个可信且可扩展的移动UI任务自动化测试平台

大语言模型(LLM)的人机协作软件工程师与开发者HCI 研究员

新兴的大型语言模型/多模态模型推动了移动代理的演进,尤其在移动UI任务自动化方面。然而,现有的评估方法依赖人工验证或使用既定数据集比较代理预测动作与预定义动作序列,存在不可扩展和不可信的问题。为克服这些局限,本文提出了LlamaTouch,一个用于设备端移动UI任务执行以及可信、可扩展任务评估的测试平台。通过观察任务执行过程仅转移UI状态,LlamaTouch采用一种新的评估方法,仅评估代理是否遍历了所有手动标注的必要应用/系统状态。LlamaTouch包含三项关键技术:(1)设备端任务执行,使移动代理能够与真实移动环境交互以执行任务;(2)细粒度UI组件标注,将像素级截图与文本屏幕层级合并,以明确识别并精确标注具有丰富设计标注原语的基本UI组件;(3)多级应用状态匹配算法,使用精确匹配和模糊匹配准确检测每屏幕中的关键信息,即使面对不可预测的UI布局/内容动态变化。LlamaTouch目前包含四个移动代理和496个任务,涵盖广泛使用的数据集以及我们自行构建的任务,以覆盖更多样化的移动应用。评估结果表明LlamaTouch在真实移动环境中具有高评估可信度,且比人工验证具有更好的可扩展性。LlamaTouch还支持简单的任务标注和新移动代理的集成。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/170831/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3654777.3676382
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
大语言模型(LLM)的人机协作
work
职业/产业
软件工程师与开发者、HCI 研究员
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文