论文
面向可靠工具增广大语言模型的自愈智能体编排器
Self-Healing Agentic Orchestrators for Reliable Tool-Augmented Large Language Model Systems
摘要
工具增强的大语言模型 (LLM) 代理依赖于协调规划、检索、工具调用、验证、内存和恢复的编排层。在这些系统中,失败不仅源于模型错误,还源于编排级别的问题,例如工具超时、格式错误的参数、过时的上下文、矛盾的证据、重试循环和未经验证的中间输出。本文提出了一种自我修复代理协调器,它将可靠性视为有界运行时控制问题。协调器将可观察的故障信号映射到推断的故障类别,在明确的预算下选择有针对性的恢复操作,验证恢复的轨迹,并记录可观察性跟踪。我们根据静态工作流程、仅重试、ReAct 风格和完全重新规划基线,在 100 个任务控制的故障注入基准上评估该方法。自我修复实现了 98.8% 的任务成功率,而仅重试的任务成功率为 94.5%,完全重新计划的任务成功率为 93.8%。匹配的恢复预算扫描显示,在每个测试的预算中,自我修复的性能优于仅重试和完全重新规划,单次恢复尝试下的最大差距:分别为 94.0%、85.3% 和 88.2%。在受控语义静默故障设置下,验证者引导的自我修复将静默故障减少到 0.0%,而非验证基线更频繁地返回错误但合理的输出。紧凑的模型在环验证表明,当实时工具调用模型通过本地故障注入工具执行工具选择、参数生成和答案综合时,可以运行相同的恢复机制。这些结果提供了受控证据,表明故障感知、预算和验证引导的编排提高了工具增强的 LLM 系统的可靠性和可诊断性。
