论文
AgentDebugX:LLM智能体失败可观测、归因与恢复的开源工具包
AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents
摘要
LLM智能体失败难以调试:错误浮出的步骤往往不是造成它的步骤。现有可观测工具重放执行轨迹,但对识别根因或把诊断转化为恢复提供的支持很少。我们提出AgentDebugX,一个开源调试框架,把调试组织为检测、归因、恢复与重跑的闭环。其核心DeepDebug通过全局轨迹理解、结构引导的调查与交叉质询执行多轮根因诊断。在Who and When基准上,DeepDebug在两个受测开放权重底座上取得受评方法中最佳的严格归因准确率:qwen3.5-9b上达28.8%的精确智能体—步骤准确率,对比最强单遍基线的21.7%。在GAIA上,DeepDebug单次重跑修复73个失败任务中的13个,对比三个解耦自纠错基线的4到6个,把总体准确率从55.8%提升到63.6%。AgentDebugX经Python库、CLI、Web控制台与可安装的智能体技能暴露该工作流,并提供可选的Error Hub,用于共享经脱敏的失败—诊断—修复包,并作为调试记忆复用。
