论文
当工具失败时:LLM智能体中动态重规划与异常恢复的基准
When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents
摘要
现有基准在理想化的“幸福路径”上评估大语言模型中的工具集成推理(TIR),很大程度上忽略了现实世界中的工具故障。我们引入 ToolMaze,它是 TIR 代理中动态路径发现和错误恢复的基准。为了将系统重新规划与盲目试错区分开来,ToolMaze 采用了二维设计:基于 DAG 的拓扑复杂性和工具扰动的 $2 × 2$ 分类法(显式/隐式、瞬态/永久)。评估表明,扰动会降低几乎所有模型的性能,其中隐式语义故障的性能下降幅度最大。由于系统对损坏的输出的过度信任,在这些场景中,扰动恢复率 (PRR) 骤降约 37%,而复杂的拓扑使代理陷入徒劳的试错循环。至关重要的是,随着模型规模比基本任务执行慢 3.66 倍,代理容错能力得到了提高,这凸显了动态重新规划是模型扩展或提示无法解决的明显瓶颈。数据和代码可在https://github.com/Zhudongsheng75/ToolMaze获取。
