论文

ToolRobustBench:工具调用代理的分阶段扰动评估和故障诊断

ToolRobustBench: Stage-Wise Perturbation Evaluation and Failure Diagnosis for Tool-Calling Agents

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 依靠工具调用作为基本代理功能,使它们能够调用外部系统并完成文本生成之外的任务。然而,干净的端到端 (E2E) 成功无法识别工具使用失败的根源或它如何通过调用传播。我们引入了 ToolRobustBench,它是工具调用代理的分阶段诊断基准,其中工具调用代理是一个 LLM 系统,它选择工具、提供结构化参数并解释其返回的反馈。 ToolRobustBench 将四个扰动系列与工具使用管道对齐:工具界面、用户意图、工具输出/观察和运行时环境扰动。它将失败归因于工具选择、模式基础、参数绑定、工具输出/运行时反馈处理和 E2E 任务成功。对 7 个模型、16 个采样本地工具、4 个扰动族和 14 个子类型的 15,456 个单族实例进行的实验显示出较高但不均匀的清洁性能和显着的鲁棒性下降,工具输出/观察扰动是主要瓶颈。混合族实验揭示了孤立的单族结果无法解释的非累加失效模式。因此,ToolRobustBench 提供了一个确定性和级联感知的基准,用于诊断超出干净工具调用准确性的鲁棒性;