DiLogics:创建具有多样化逻辑的网络自动化程序
作者
大语言模型(LLM)的人机协作知识工作者工具与工作流软件工程师与开发者UI/UX 设计师
文献标题
DiLogics: Creating Web Automation Programs With Diverse Logics
文献信息
- 主题领域: 编程自动化、人机交互、自然语言处理
- 关键词: Web自动化, PBD (Programming-By-Demonstration), 神经符号编程, 自然语言处理, GUI自动化, 用户体验, 编程逻辑, 任务语义, 自动化错误处理, 人机协作
研究背景与问题
-
问题或挑战:
- Web自动化工具通常局限于执行固定顺序的UI操作,而难以应对具有多样输入条件的任务。
- 现有工具需要专业领域知识,初学者难以快速上手创建所需的自动化程序。
- 当任务中的输入要求语义多样时,现有工具难以基于多样性进行程序逻辑的泛化和扩展。
- 人工操作重复性高、容易出错且耗时,尤其是在复杂条件逻辑下。
-
重要性:
- 自动化可以提高生产率,减少人工失误,但现有工具不足以灵活应对多样化任务需求。
- 通过降低编程壁垒和增强工具智能,Web自动化将更普及并满足更多实际场景需求。
-
研究动机与相关工作:
- 受限于逻辑统一的现有PBD(例如SemanticOn和Rousillon)的约束,复杂任务要求更智能和灵活的工具。
- 神经符号编程被提出作为兼具神经网络灵活性和符号推理精确性的解决方案,但在Web自动化中的应用尚不成熟。
- 商业工具(如UiPath和Taxy AI)虽提供高抽象级的自然语言任务指定,但用户修改和细化程序逻辑的能力有限。
解决方案
-
方法与创新:
- 提出DiLogics——一种基于示范的工具,结合自然语言处理(NLP)和神经符号编程,帮助非专业用户创建多样化Web自动化程序。
- 使用NLP对输入数据进行语义切分,将任务分解为易管理的步骤。
- 通过记录用户的示范动作,生成与任务语义相关联的GUI操作映射。
- 系统基于相似的语义任务推理UI操作逻辑,从而实现跨任务和跨页面的泛化。
- 集成错误处理机制,在生成程序的同时允许用户在任何阶段编辑和优化逻辑。
-
实施步骤及技术:
- 用户上传任务输入数据(例如JSON文件),DiLogics对其进行语义切分,生成任务步骤。
- 用户通过浏览器插件,用UI操作演示任务如何完成。系统动态解析网页内容,匹配对应语义UI元素。
- 经过两轮示范后,系统生成自动化程序并进入半自动化模式,用户校验建议动作。
- 系统通过语义匹配对新任务语义进行泛化。若遇到全新步骤,暂停自动化并要求用户示范。
- 用户在流程中可随时暂停、编辑任务要求、重新定义逻辑,支持错误修复。
-
创新点:
- 借助神经符号编程方法,结合符号推理(规则识别)与统计学习(语义匹配),实现任务逻辑与UI动作的动态绑定。
- 引入“多样编程逻辑”(diverse programming logics)概念,使程序能够处理基于输入数据的多样化执行路径。
- 提供语义增强的任务到UI操作映射,克服传统仅基于页面结构的工具局限。
研究成果
-
具体成果:
- 开发了DiLogics系统,并成功运用于多个常见Web自动化任务(如餐厅订单、购物、药物搜索、票务操作)。
- 在用户研究中,通过10位参与者的40个实验任务验证了系统在任务语义分类、步骤演示和逻辑泛化上的有效性。
-
优势:
- 对比现有工具,DiLogics无需编程知识即可处理多样任务逻辑,特别是在语义复杂的多条件任务中表现出色。
- 系统具有直观的交互流程,用户可以通过自然的任务描述和动作演示持续优化程序。
- 提供了灵活错误处理功能,如任务重定义、步骤重示范等。
-
实验结果:
- 在用户实验中,平均任务完成时间为8分钟,平均任务精确度为91.2%。
- 系统被认为易于使用(用户满意度均分为6.1/7),能帮助用户完成以前需人工操作的大量重复性任务。
-
局限性与未来方向:
- 局限于基于文本内容的网页,无法处理基于图片或图形化用户界面的任务元素。
- 模型对新任务步骤的泛化需要两轮初始示范,不支持一次性“零示范”。
- 输入数据需要是结构化(如表格),对非结构化文本任务支持有限。
未来工作方向
- 扩展多模态能力: 通过引入多模态模型(例如CLIP),扩展对网页图片、图标等视觉信息的理解。
- 增强任务状态监控: 开发实时网页状态分析工具,使系统能动态检查任务完成进度和UI状态。
- 引入任务历史复用: 通过任务完成记录自动推荐先前任务的逻辑和脚本,提高编程效率。
本研究为提升Web自动化工具的语义理解力和使用友好性提供了重要参考,同时为后续人工智能在任务自动化中的应用奠定了基础。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3lightbulb
现实痛点
1- 普通用户难以创建应对多语义条件的网页自动化程序。分类: 个人多模态记忆检索同类问题arrow_forward
- 100%
SQUIRE:通过插槽查询中间表示实现交互式 UI 创作
UIST '25· 大语言模型(LLM)的人机协作 +1
- 75%
Tap&Say:结合触摸位置的大型语言模型,用于智能手机上的多模态文本校正
CHI '25· 大语言模型(LLM)的人机协作
- 67%
知识工作中的人工智能生成技术:数据导航和决策制定的设计影响
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 67%
设计活动模拟:利用多个通信 AI 代理解决设计问题的机遇与挑战
CUI '25· 大语言模型(LLM)的人机协作 +2
- 67%
设计支持跨会议时间性工作的生成式人工智能界面
DIS '25· 生成式AI(文本、图像、音乐、视频) +2
- 67%
SkipWriter:平板电脑上的LLM驱动缩写手写输入
UIST '24· 大语言模型(LLM)的人机协作 +2
- 60%
GestAKey: 个体键帽上的触控交互
CHI '18· 手部手势识别 +1
- 60%
工作场所技术支持的活动报告的挑战与机遇
CHI '18· 知识管理与团队意识 +1
- 60%
ActiveErgo:使用自我驱动家具实现自动和个性化的工效学
CHI '18· 全身交互与体感输入 +1
- 60%
通过文件简历探索网络世界的新型文件隐喻
CHI '18· 知识工作者工具与工作流 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3586183.3606822
一眼看懂
fact_check论文快照
dataset
来源
UIST
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、知识工作者工具与工作流
work
职业/产业
软件工程师与开发者、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文