论文

AgentTether:图形引导诊断和运行时干预,实现可靠的 LLM 代理操作

AgentTether: Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operation

智能体系统Agent HarnessAgent Runtime

摘要

大语言模型 (LLM) 代理越来越多地用于多步骤、有状态的工具使用任务,但生产可靠性仍然有限。与静态软件修复不同,代理修复必须恢复动态轨迹,其早期决策可能会传播到以后的错误和外部状态更改。现有的自动补救措施只能解决这个问题的一部分:盲目重试无法增加诊断,结果反馈表明运行是否失败,但没有说明失败的地点或原因,而自我反思通常缺乏坚实的证据来防止同样的失败再次发生。我们推出了 AgentTether,这是一个运行时修复框架,可以自动执行运行后诊断和引导恢复,而无需修改底层代理或环境。 AgentTether 将每次运行抽象为转换单元,通过依赖性感知关键转换图将它们链接起来,并通过将离线正常行为模型与运行本地图检测器相结合来本地化故障关键子轨迹。然后,它将局部原因转换为由交叉迭代修复内存支持的行为范围指导,并且可以选择应用受保护的运行时干预,以在重新执行期间保持更正活动。相同的设计可以部署为离线诊断和指导工具或在线修复层。我们使用 Qwen3.7-max 在跨三个领域的 261 个 tau 基准任务上评估 AgentTether,并使用 GPT-5.4 测试银行业的跨模型传输。在最困难的银行领域,AgentTether 修复了 59.04% (49/83) 最初失败的 Qwen3.7-max 任务和 65.12% (56/86) 最初失败的 GPT-5.4 任务。总体而言,AgentTether 提高了修复效率,同时减少了代理轮次和端到端方法词元,这表明了一个实用的可靠性层,可以包装现有代理部署,减少浪费的重新执行,并在无需重新训练代理的情况下提高恢复速度。