VAL:使用GPT对话解析进行交互式任务学习
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统软件工程师与开发者AI/ML 研究员与工程师
文献标题
VAL: Interactive Task Learning with GPT Dialog Parsing
文献信息
- 主题领域: 人机交互、任务学习、自然语言处理
- 关键词: 分层任务网络, GPT, 大语言模型 (LLMs), 神经符号AI, 混合AI
研究背景与问题
- 背景:
- 交互式任务学习 (Interactive Task Learning, ITL) 是一种在人类自然交互中增量获取任务知识的方法,旨在使计算机能够通过人类的教学从语言中学习普适性任务。
- 现有ITL系统依赖语法语义解析,但常因解析错误导致交互不自然和易碎性问题。大语言模型(LLMs)在语义理解上更灵活,但缺乏增量学习能力和可解释性。
- 问题或挑战:
- 如何结合LLMs的优势与经典符号学习的透明和可扩展性以实现ITL。
- 当前ITL系统语言解析功能的脆弱性,难以支持复杂且自然的对话场景。
- 对语言中的共指解析、语义歧义处理以及任务泛化能力的不足。
- 研究重要性:
- 推动ITL系统发展,使其能够使用自然语言与人类交互,同时保持可解释性和通用性。
- 改进人机交互体验,使泛化性和人类指导成为可能。
- 研究动机: 提出一种有效的神经符号混合框架,以解决上述挑战。
解决方案
-
提出方法:
- 开发一个名为VAL (Verbal Apprentice Learner) 的ITL系统,结合GPT家族的大语言模型(LLMs)与符号任务学习框架。
- 系统专注于通过自然语言对话学习分层任务知识,结合LLMs完成特定子任务(如谓词选择等),而非端到端依赖LLMs。
-
创新之处:
- 独特的神经符号混合架构:
- 将GPT用于语义解析和对话中的子任务处理(如谓词提取和参数选择)。
- 使用经典分层任务网络 (HTN) 表示任务结构。
- 通过确认对话和撤销操作减少连锁错误,提高交互体验可用性。
- 允许增量学习和任务泛化,支持从自然语言对话中教学。
- 提供用户友好的任务知识可视化。
- 独特的神经符号混合架构:
-
实施步骤:
- 使用"VALgorithm"算法结构化自然语言输入:
- 拆分用户输入为原子步骤;
- 使用GPT完成谓词匹配、参数映射和验证。
- 提供分层任务网络(Hierarchical Task Networks, HTN)框架,学习任务层级关系。
- 借助用户交互确认界面实现错误校正。
- 设计一个实时的交互界面,便于用户教学以及任务监控。
- 在视频游戏环境(如Overcooked-AI)中测试系统学习效果。
- 使用"VALgorithm"算法结构化自然语言输入:
研究成果
- 具体成果:
- VAL 系统能够通过少量自然语言交互增量学习复杂任务的层级结构(如Overcooked游戏任务)。
- 提供直观的知识表示(如实时可视化和确认对话界面),提高系统用户体验。
- 优势:
- 与当前ITL系统相比,VAL在理解语法错误、不自然表达和歧义语言上的鲁棒性显著提高。
- 集合了LLMs对于灵活语言理解的优势,同时保留了基于HTN的符号学习的可解释性。
- 支持更丰富和自然的用户交互,优化用户参与体验。
- 实验结果:
- 在12名参与者组成的用户研究中,VAL被证明能够完成大部分任务学习。
- 用户主观感受普遍为“易于使用”和“自然”,但也指出确认对话频繁仍会增加互动的乏味性。
- 不同子模块的平均准确率较高,尤其是在输入语段分割和参数映射部分。
- 局限性与未来方向:
- 确认对话的过于频繁增加了用户疲劳感,未来可尝试减少不必要确认。
- 增加对环境感知和自动任务生成的功能以减少用户教学负担。
- 在其他任务模块和多模式交互(如视觉和手势)上扩展VAL的能力。
- 使用开源模型替代商业化LLMs以提高系统透明性和可扩展性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何结合大型语言模型(LLMs)的语义理解能力和经典符号学习的透明性与可扩展性,改进互动式任务学习(ITL)系统?分类: LLM界面、提示与交互理解同类问题arrow_forward
- 面向复杂自然语言对话情景,如何降低现有语义解析的脆弱性并提升互动体验?分类: LLM界面、提示与交互理解同类问题arrow_forward
- 怎样通过自然语言对话实现分层任务知识的增量学习和任务泛化?分类: LLM界面、提示与交互理解同类问题arrow_forward
lightbulb
现实痛点
1- 现有系统难以通过自然交互学习复杂任务,交互体验差。分类: LLM界面、提示与交互理解同类问题arrow_forward
- 100%
在人工智能中介沟通中比较句子层面的建议和消息层面的建议
CHI '23· 大语言模型(LLM)的人机协作 +1
- 100%
需要帮助吗?为编程设计主动型AI助手
CHI '25· 大语言模型(LLM)的人机协作 +1
- 80%
胜任但僵化:识别赋予AI平等参与群体决策能力的差距
CHI '23· 大语言模型(LLM)的人机协作 +1
- 80%
为什么约翰尼不能提示:非AI专家如何尝试(并失败)设计LLM提示
CHI '23· 大语言模型(LLM)的人机协作 +1
- 80%
行间阅读:建模AI辅助编程中的用户行为和成本
CHI '24· 大语言模型(LLM)的人机协作 +2
- 80%
从大规模交互痕迹中自动挖掘宏命令
CHI '24· 大语言模型(LLM)的人机协作 +1
- 80%
"如果机器和我一样好,那我还有什么用?" – 使用ChatGPT如何改变年轻专业人士对生产力和成就的看法
CHI '24· 大语言模型(LLM)的人机协作 +1
- 80%
多智能体AI系统的交互式调试和引导
CHI '25· 大语言模型(LLM)的人机协作 +2
- 80%
GenComUI:探索生成式视觉辅助作为支持任务导向人机通信的媒介
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 80%
专业能力的新表现:软件工程师使用AI编码助手评估和展示编码专长
CHI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3641915
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文