论文

AgentFixer:LLM Agentic系统从故障检测到修复建议

AgentFixer: From Failure Detection to Fix Recommendations in LLM Agentic Systems

AI 基础设施可观测性

摘要

我们提出一个面向基于LLM的Agentic系统的综合验证框架,对可靠性故障进行系统诊断与改进。框架含十五个故障检测工具与两个根因分析模块,共同揭示输入处理、提示设计与输出生成方面的弱点。它把轻量规则检查与LLM评审评估结合,支持结构化的事件检测、分类与修复。我们把该框架应用于IBM CUGA,在AppWorld与WebArena基准上评估其表现。分析揭示了反复出现的规划器错位、模式违反、脆弱的提示依赖等问题。基于这些洞见,我们改进了提示与代码策略,在保持CUGA基准成绩的同时,让Llama 4与Mistral Medium等中型模型取得显著准确率提升,大幅缩小与前沿模型的差距。除定量验证外,我们还开展了探索性研究,把框架的诊断输出与智能体描述交给LLM做自我反思与优先级排序。这一交互式分析产出了关于反复失败模式与改进重点的可操作洞见,展示验证本身如何演化为Agentic的、对话驱动的过程。这些结果展示了在生产Agentic系统中实现可扩展质量保障与自适应验证的路径,为更稳健、可解释、可自我改进的Agentic架构奠定基础。

AgentFixer:LLM Agentic系统从故障检测到修复建议
图2:用于多智能体系统分析的交互式诊断仪表板。左侧面板从工具级日志中识别工作流瓶颈,右侧面板按LLM可靠性问题对智能体排名,底部面板为提示改进、结构重设计与跨智能体工程实践提供数据驱动的后续步骤。