论文

当工具失败时:LLM智能体中动态重规划与异常恢复的基准

When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents

智能体系统Agent任务评测

摘要

现有基准在理想化的“幸福路径”上评估大语言模型中的工具集成推理(TIR),很大程度上忽略了现实世界中的工具故障。我们引入 ToolMaze,它是 TIR 代理中动态路径发现和错误恢复的基准。为了将系统重新规划与盲目试错区分开来,ToolMaze 采用了二维设计:基于 DAG 的拓扑复杂性和工具扰动的 $2 × 2$ 分类法(显式/隐式、瞬态/永久)。评估表明,扰动会降低几乎所有模型的性能,其中隐式语义故障的性能下降幅度最大。由于系统对损坏的输出的过度信任,在这些场景中,扰动恢复率 (PRR) 骤降约 37%,而复杂的拓扑使代理陷入徒劳的试错循环。至关重要的是,随着模型规模比基本任务执行慢 3.66 倍,代理容错能力得到了提高,这凸显了动态重新规划是模型扩展或提示无法解决的明显瓶颈。数据和代码可在https://github.com/Zhudongsheng75/ToolMaze获取。

当工具失败时:LLM智能体中动态重规划与异常恢复的基准:论文配图
图 2:ToolMaze 框架概述,说明其主要组件:(1) 从精选工具语料库生成任务,(2) 拓扑任务复杂性的四个级别 (𝒞​1\mathcal{C}1–𝒞​4\mathcal{C}4),(3) 2×22\times 2 扰动模式分类(𝒫​1\mathcal{P}1–𝒫​4\mathcal{P}4),以及 (4) 评估框架,其指标包括 TSR、PRR 和 RC。