论文

AgentDebugX:LLM智能体失败可观测、归因与恢复的开源工具包

AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

AI 基础设施智能体系统Agent Harness可观测性

摘要

LLM智能体失败难以调试:错误浮出的步骤往往不是造成它的步骤。现有可观测工具重放执行轨迹,但对识别根因或把诊断转化为恢复提供的支持很少。我们提出AgentDebugX,一个开源调试框架,把调试组织为检测、归因、恢复与重跑的闭环。其核心DeepDebug通过全局轨迹理解、结构引导的调查与交叉质询执行多轮根因诊断。在Who and When基准上,DeepDebug在两个受测开放权重底座上取得受评方法中最佳的严格归因准确率:qwen3.5-9b上达28.8%的精确智能体—步骤准确率,对比最强单遍基线的21.7%。在GAIA上,DeepDebug单次重跑修复73个失败任务中的13个,对比三个解耦自纠错基线的4到6个,把总体准确率从55.8%提升到63.6%。AgentDebugX经Python库、CLI、Web控制台与可安装的智能体技能暴露该工作流,并提供可选的Error Hub,用于共享经脱敏的失败—诊断—修复包,并作为调试记忆复用。

AgentDebugX:LLM智能体失败可观测、归因与恢复的开源工具包:论文配图
图 1:AgentDebugX 概述。 AgentDebugX 形成一个封闭的调试循环:检测识别步骤级错误,属性定位其根本原因,恢复建议排序修复,重新运行重新生成故障点周围的轨迹。疑难病例会升级为 DeepDebug,这是一种多轮诊断代理,可生成可审核的根本原因报告,其中包含证据和建议的修复方案。 AgentDebugX 支持本地和 Web UI、可重用错误共享、基线评估和广泛的代理框架兼容性。