论文
ToolFailBench:诊断 LLM 代理中的工具使用故障
ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents
摘要
工具调用是现代语言模型代理的核心,但总体基准分数通常隐藏工具使用失败的地方。从不调用所需工具的模型和调用该工具但忽略结果的模型在最终任务准确性下看起来很相似。我们推出了 ToolFailBench,这是一个诊断基准,用于测量金融、医学、法律、网络安全和房地产领域 1,000 项任务中工具使用失败的情况。需要工具的任务返回模型无法猜测的值,迫使模型信任该工具,而控制任务则附加相同的工具,但应直接回答。我们使用规则分类器和两个通过多数投票聚合的 LLM 判断器,用 Tool-Skip、Result-Ignore、Output-Fabrication 和 Unnecessary-Tool-Use 标记每个跟踪。在 19 个头条车型中,最好的工具清洁使用率达到 86.33%,表明忠实的工具使用并未饱和。更重要的是,具有相似总分的模型以不同的方式失败:大多数模型在无工具控制上保持纪律,而 Llama-3.1 模型显示出始终调用模式,并且在相同的参数范围下,Llama-3.1-70B 和 Qwen2.5-72B 在控制任务准确性上相差 89 个百分点。工具使用评估不仅应该衡量智能体是否调用工具,还应该衡量他们是否正确使用工具输出并在不需要时避免使用工具。