LlamaTouch:一个可信且可扩展的移动UI任务自动化测试平台
作者
新兴的大型语言模型/多模态模型推动了移动代理的演进,尤其在移动UI任务自动化方面。然而,现有的评估方法依赖人工验证或使用既定数据集比较代理预测动作与预定义动作序列,存在不可扩展和不可信的问题。为克服这些局限,本文提出了LlamaTouch,一个用于设备端移动UI任务执行以及可信、可扩展任务评估的测试平台。通过观察任务执行过程仅转移UI状态,LlamaTouch采用一种新的评估方法,仅评估代理是否遍历了所有手动标注的必要应用/系统状态。LlamaTouch包含三项关键技术:(1)设备端任务执行,使移动代理能够与真实移动环境交互以执行任务;(2)细粒度UI组件标注,将像素级截图与文本屏幕层级合并,以明确识别并精确标注具有丰富设计标注原语的基本UI组件;(3)多级应用状态匹配算法,使用精确匹配和模糊匹配准确检测每屏幕中的关键信息,即使面对不可预测的UI布局/内容动态变化。LlamaTouch目前包含四个移动代理和496个任务,涵盖广泛使用的数据集以及我们自行构建的任务,以覆盖更多样化的移动应用。评估结果表明LlamaTouch在真实移动环境中具有高评估可信度,且比人工验证具有更好的可扩展性。LlamaTouch还支持简单的任务标注和新移动代理的集成。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 100%
MAPLE:利用大型语言模型嵌入的移动应用预测
UbiComp '24· 大语言模型(LLM)的人机协作
- 75%
情感聚焦:促进在线演示过程中观众成员情感反应的交流
CHI '21· VR 中的社交与协作 +1
- 75%
评估大型语言模型在生成合成HCI研究数据中的应用:一个案例研究
CHI '23· 大语言模型(LLM)的人机协作 +1
- 75%
DynEx:具有结构化设计探索的动态代码合成以加速探索性编程
CHI '25· 大语言模型(LLM)的人机协作 +1
- 75%
SummAct:通过交互行为总结揭示用户意图
CHI '25· 大语言模型(LLM)的人机协作 +1
- 75%
面向快速交互式机器学习:无表示分类的权衡评估
IUI '19· 大语言模型(LLM)的人机协作 +1
- 75%
探索未知:面向个性化探索任务的聊天式协作界面
IUI '25· 大语言模型(LLM)的人机协作 +1
- 75%
Assuage:使用引导探索的汇编合成
UIST '21· 大语言模型(LLM)的人机协作 +1
- 75%
Shapir:标准化和民主化 Web API 访问
UIST '21· 大语言模型(LLM)的人机协作 +1
- 75%
谁验证验证者?将LLM辅助的LLM输出评估与人类偏好对齐
UIST '24· 大语言模型(LLM)的人机协作
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)