DiLLS:基于智能体行为分层摘要的LLM多智能体系统交互式诊断

大语言模型(LLM)的人机协作AI 辅助决策与自动化系统可解释人工智能(XAI)计算方法在HCI中的应用软件工程师与开发者AI/ML 研究员与工程师HCI 研究员

文献标题

DiLLS: Interactive Diagnosis of LLM-based Multi-agent Systems via Layered Summary of Agent Behaviors

出版信息

  • 主题领域: 基于LLM的多智能体系统的诊断与调试。
  • 关键词: LLM,多智能体系统,调试,诊断,活动理论,分层摘要,可视化,人工智能开发,故障分析,交互工具。

背景与问题

  • 问题/挑战: 基于LLM的多智能体系统的故障诊断具有挑战性,原因在于系统的复杂性、非结构化的执行日志以及智能体行为的多样性。现有工具通常无法提供高层次的摘要或可操作的调试洞察。
  • 重要性: 有效的故障诊断对于提升多智能体系统的性能至关重要,这些系统正越来越多地应用于复杂领域,如网络搜索、科学研究和软件开发。
  • 动机与相关工作: 当前的诊断工具(例如AutoGen Studio、LangSmith)主要关注执行历史或可视化,但缺乏结构化的、多层次的摘要,无法帮助开发者识别故障的根本原因。本文通过引入一种基于活动理论的分层框架来填补这一空白。

解决方案

  • 提出的方法: DiLLS(基于LLM的分层摘要诊断系统),一个交互式系统,将多智能体行为组织为三个分层结构:活动(activity)、行动(action)和操作(operation)。
  • 创新点:
    1. 基于活动理论的三层框架,用于结构化智能体行为以支持故障诊断。
    2. 集成自然语言探测技术,提取智能体的隐性推理和进展。
    3. 提供交互式可视化工具,用于在不同层次上导航和分析多智能体行为。
    4. 通过与AI开发者的用户研究验证其有效性。
  • 流程与关键技术:
    • 将智能体行为提取并总结为活动(高层计划)、行动(目标导向过程)和操作(低层任务)。
    • 使用自然语言探测技术引导智能体推理和进展。
    • 提供交互式可视化工具:活动视图(计划概览)、行动视图(执行步骤)和操作视图(详细日志)。
    • 支持过滤和导航功能,以连接各层次之间的相关行为。

结果

  • 具体发现:
    • 使用DiLLS的参与者平均识别出3.67个故障,而基线系统仅为2.25个(p < 0.05)。
    • 使用DiLLS的参与者在故障识别上的一致性更高(所有参与者的一致性为58%,基线系统为20%)。
    • 用户信心显著提升(平均信心评分:4.50 vs. 3.42,p < 0.05)。
    • 在NASA-TLX维度上显著降低了认知负担,包括心理需求、努力程度和挫败感。
  • 相较基线的优势:
    • 增强了检测高层故障的能力,如问题规划和行动跳过。
    • 更好地支持追踪探索过程和优化假设。
    • 更清晰地连接计划、行动和操作之间的关系。
  • 实验/评估:
    • 用户研究包括12名参与者(6男,6女,年龄24.17 ± 2.66岁),来自学术界和工业界。
    • 任务涉及使用DiLLS和基线系统诊断GAIA基准中的四个案例错误。
    • 评估指标:识别的故障数量、信心评分、NASA-TLX得分以及定性反馈。
  • 局限性与未来工作:
    • 研究仅关注故障诊断,而未涉及后续的调试或系统修改。
    • 诊断结果具有主观性,依赖参与者的证据和解释。
    • 未来工作包括长期研究、多智能体行为的更广泛挑战,以及活动理论构建的更深层次整合。

总结

本文提出了DiLLS,一个通过将智能体行为组织为活动、行动和操作三个分层结构来诊断基于LLM的多智能体系统故障的交互式系统。受活动理论启发,该系统结合自然语言探测和交互式可视化工具,帮助开发者高效地识别、理解和分析故障。用户研究表明,与基线工具相比,DiLLS显著提升了诊断准确性、信心和认知负担。该框架为调试多智能体系统提供了实用解决方案,并为可扩展且直观的诊断工具的未来研究奠定了基础。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223278/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790815
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、可解释人工智能(XAI)、计算方法在HCI中的应用
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文