从大规模交互痕迹中自动挖掘宏命令
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统软件工程师与开发者AI/ML 研究员与工程师HCI 研究员
文献标题
Automatic Macro Mining from Interaction Traces at Scale
文献信息
- 主题领域: HCI(人机交互),宏挖掘,移动 UI 自动化
- 关键词: 用户任务, 宏, 大语言模型, 移动用户界面, 任务自动化, 轨迹挖掘, LLM, 下游应用
研究背景与问题
- 问题与挑战:
- 移动应用中的“宏”(macro)作为任务自动化的重要组成部分,通常需要用户多步操作完成。但由于涉及多个视图和上下文依存,这些宏难以从交互日志中大规模提取。
- 现有方法(如通过示例编程)难以获取高层次复杂宏。
- 即使通过人工或众包生成任务,覆盖所有移动应用功能性仍具有挑战。
- 重要性: 自动提取宏对用户体验理解、任务自动化以及知识共享具有重要意义。抽象和自动执行这些宏有助于更高效地支持交互设计和开发。
- 研究动机:
- 随着大语言模型(LLMs)的发展,探索其在移动交互轨迹上的潜力可以为宏提取提供新途径。
解决方案
- 方法/系统:
- 任务发现:基于移动应用的交互 UI 树,利用 LLM 提取用户可能完成的任务;
- 动作映射:通过 LLM 推断为完成任务所需的具体 UI 操作;
- 参数查找:提取完成任务所需的额外信息(如标题或时间)。
- 动作合并与路径优化:基于多个交互轨迹构建交互图,利用最短路径算法优化多余的用户步骤。
- 宏重放器(宏执行器):实现自动重放提取的宏以验证和展示自动化功能。
- 技术核心:
- 使用 LLM 的“链式思维”(chain-of-thought)能力分步骤构建语义化高层任务;
- 采用动态轨迹合并和图遍历优化用户操作路径,从多样性轨迹中抽象最优执行方案。
- 系统数据源:
- 查询真实用户和随机轨迹数据集,包括 RICO 和 Rehearsal 数据集;
- 每个轨迹通过 UI 层级结构、截图和用户动作信息记录。
- 系统特点:
- 不依赖人工输入和专门的应用代码,
- 生成的宏不仅带有自然语言描述,还具有可重放性和多任务扩展能力。
研究成果
- 成果简述:
- 自动从移动应用轨迹中提取了语义化、高效的 23,777 项宏,从 4,189 条轨迹中提取(平均每个 App 提取 8.49 项)。
- 在 Rehearsal 数据集上的宏提取显示了更高的深度覆盖能力。
- 提出的系统显著减少了非必要步骤,如在 RICO 数据集上减少了 43.6%的宏路径长度。
- 提取的 76.7% 宏可在真实环境的 Android 仿真器中成功执行。
- 创新点:
- 首次证明了可以通过 LLM 从 UI 轨迹中“语义化解释”任务,同时生成直接可用的自动流程。
- 提取的宏超越了现有任务数据集 MoTIF 的任务覆盖范围,增强了交互分析能力。
- 实验表明,模型生成的描述与人工任务相比,Rouge-L 分数达到 0.47,显示强相关性。
- 局限性:
- 合并节点可能由于 UI ID 重复导致路径错误。
- 假设操作是无状态的,忽略了某些依赖动态上下文的 UI 行为。
- 未来工作:
- 提升节点辨识的唯一性与准确性;引入基于上下文和学习的框架。
- 考虑状态依赖的操作执行逻辑。
- 扩展到更多类型的 UI 任务和领域以增强泛化能力。
展望
- 应用前景:
- 交互任务理解与建模:数据集可支持训练 UI 导航和完成复杂任务的智能代理。
- 交互自动化:结合语言模型的自然语言任务选择器与重放器,提升任务执行自动化能力。
- 知识共享:可用于生成教程和自动化指导,尤其是未被用户发现的功能路径。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何利用大语言模型(LLM)从移动应用的交互日志中提取语义丰富的宏任务?分类: GUI/IoT 任务自动化与界面生成同类问题arrow_forward
- 如何在多条交互路径中优化用户操作,生成高效的宏任务?分类: GUI/IoT 任务自动化与界面生成同类问题arrow_forward
- 提取的宏任务能否用于验证和重现移动应用中的自动化功能?分类: GUI/IoT 任务自动化与界面生成同类问题arrow_forward
lightbulb
现实痛点
1- 用户需要多步操作完成任务,移动应用中难以高效提取宏任务。分类: GUI/IoT 任务自动化与界面生成同类问题arrow_forward
- 100%
胜任但僵化:识别赋予AI平等参与群体决策能力的差距
CHI '23· 大语言模型(LLM)的人机协作 +1
- 100%
为什么约翰尼不能提示:非AI专家如何尝试(并失败)设计LLM提示
CHI '23· 大语言模型(LLM)的人机协作 +1
- 83%
Stack Overflow 过时了吗?对 ChatGPT 回答 Stack Overflow 问题特征的经验研究
CHI '24· 大语言模型(LLM)的人机协作 +2
- 83%
看不见的破坏者:谄媚型大语言模型在问题解决任务中误导新手
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
响应延迟和任务类型对人类-LLM 交互与感知的影响
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
氛围编程的纠缠——重新定位生成式 AI 编程中意图、作者身份与责任的边界
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 83%
与我共编还是为我编程?AI 自动化程度提升如何改变开发者工作流
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
CoExplorer 技术探针:支持视频会议规划和运行意图性的生成式AI驱动自适应界面
DIS '24· 大语言模型(LLM)的人机协作 +2
- 83%
多智能体生成式AI的设计:行业早期采用者的洞察
DIS '25· 大语言模型(LLM)的人机协作 +2
- 83%
基于知识图谱补全的对话式领域知识获取问题选择框架
IUI '21· 对话式聊天机器人 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642074
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文