DiLLS:基于智能体行为分层摘要的LLM多智能体系统交互式诊断
作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统可解释人工智能(XAI)计算方法在HCI中的应用软件工程师与开发者AI/ML 研究员与工程师HCI 研究员
文献标题
DiLLS: Interactive Diagnosis of LLM-based Multi-agent Systems via Layered Summary of Agent Behaviors
出版信息
- 主题领域: 基于LLM的多智能体系统的诊断与调试。
- 关键词: LLM,多智能体系统,调试,诊断,活动理论,分层摘要,可视化,人工智能开发,故障分析,交互工具。
背景与问题
- 问题/挑战: 基于LLM的多智能体系统的故障诊断具有挑战性,原因在于系统的复杂性、非结构化的执行日志以及智能体行为的多样性。现有工具通常无法提供高层次的摘要或可操作的调试洞察。
- 重要性: 有效的故障诊断对于提升多智能体系统的性能至关重要,这些系统正越来越多地应用于复杂领域,如网络搜索、科学研究和软件开发。
- 动机与相关工作: 当前的诊断工具(例如AutoGen Studio、LangSmith)主要关注执行历史或可视化,但缺乏结构化的、多层次的摘要,无法帮助开发者识别故障的根本原因。本文通过引入一种基于活动理论的分层框架来填补这一空白。
解决方案
- 提出的方法: DiLLS(基于LLM的分层摘要诊断系统),一个交互式系统,将多智能体行为组织为三个分层结构:活动(activity)、行动(action)和操作(operation)。
- 创新点:
- 基于活动理论的三层框架,用于结构化智能体行为以支持故障诊断。
- 集成自然语言探测技术,提取智能体的隐性推理和进展。
- 提供交互式可视化工具,用于在不同层次上导航和分析多智能体行为。
- 通过与AI开发者的用户研究验证其有效性。
- 流程与关键技术:
- 将智能体行为提取并总结为活动(高层计划)、行动(目标导向过程)和操作(低层任务)。
- 使用自然语言探测技术引导智能体推理和进展。
- 提供交互式可视化工具:活动视图(计划概览)、行动视图(执行步骤)和操作视图(详细日志)。
- 支持过滤和导航功能,以连接各层次之间的相关行为。
结果
- 具体发现:
- 使用DiLLS的参与者平均识别出3.67个故障,而基线系统仅为2.25个(p < 0.05)。
- 使用DiLLS的参与者在故障识别上的一致性更高(所有参与者的一致性为58%,基线系统为20%)。
- 用户信心显著提升(平均信心评分:4.50 vs. 3.42,p < 0.05)。
- 在NASA-TLX维度上显著降低了认知负担,包括心理需求、努力程度和挫败感。
- 相较基线的优势:
- 增强了检测高层故障的能力,如问题规划和行动跳过。
- 更好地支持追踪探索过程和优化假设。
- 更清晰地连接计划、行动和操作之间的关系。
- 实验/评估:
- 用户研究包括12名参与者(6男,6女,年龄24.17 ± 2.66岁),来自学术界和工业界。
- 任务涉及使用DiLLS和基线系统诊断GAIA基准中的四个案例错误。
- 评估指标:识别的故障数量、信心评分、NASA-TLX得分以及定性反馈。
- 局限性与未来工作:
- 研究仅关注故障诊断,而未涉及后续的调试或系统修改。
- 诊断结果具有主观性,依赖参与者的证据和解释。
- 未来工作包括长期研究、多智能体行为的更广泛挑战,以及活动理论构建的更深层次整合。
总结
本文提出了DiLLS,一个通过将智能体行为组织为活动、行动和操作三个分层结构来诊断基于LLM的多智能体系统故障的交互式系统。受活动理论启发,该系统结合自然语言探测和交互式可视化工具,帮助开发者高效地识别、理解和分析故障。用户研究表明,与基线工具相比,DiLLS显著提升了诊断准确性、信心和认知负担。该框架为调试多智能体系统提供了实用解决方案,并为可扩展且直观的诊断工具的未来研究奠定了基础。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 88%
人机协同机器训练界面设计指南的探索
IUI '21· 大语言模型(LLM)的人机协作 +3
- 86%
PaTAT:具有可解释交互规则合成的人工智能协作定性编码
CHI '23· 可解释人工智能(XAI) +2
- 86%
故障还是就绪?在部署之前处理深度学习计算机视觉模型中的故障:一项关于实践、挑战和需求的研究
CHI '23· 可解释人工智能(XAI) +2
- 86%
看不见的破坏者:谄媚型大语言模型在问题解决任务中误导新手
CHI '26· 大语言模型(LLM)的人机协作 +2
- 86%
响应延迟和任务类型对人类-LLM 交互与感知的影响
CHI '26· 大语言模型(LLM)的人机协作 +2
- 86%
与我共编还是为我编程?AI 自动化程度提升如何改变开发者工作流
CHI '26· 大语言模型(LLM)的人机协作 +2
- 86%
Unakite:利用 Web 支持开发者的决策制定
UIST '19· 可解释人工智能(XAI) +2
- 75%
当帮助变成伤害:AI编码助手的验证负荷与疲劳
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
胜任但僵化:识别赋予AI平等参与群体决策能力的差距
CHI '23· 大语言模型(LLM)的人机协作 +1
- 71%
为什么约翰尼不能提示:非AI专家如何尝试(并失败)设计LLM提示
CHI '23· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790815
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、可解释人工智能(XAI)、计算方法在HCI中的应用
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文