论文
基准测试:工具调用评估的有效性审核
Benchmarking the Benchmarks: A Validity Audit of Tool-Calling Evaluation
摘要
工具调用基准越来越多地用于对语言模型代理进行排名,但它们的分数通常被视为 真值,而不验证评估器本身。我们对四个主要工具调用基准系列进行了系统有效性和可重复性审核:BFCL v4、τ2-Bench、LiveMCPBench 和 MCP-Atlas。在 496 个专家评审的基准任务中,我们发现了 92 个评估者与人类的分歧,相当于 18.5% 的错位率。这些失败并不是孤立的注释错误:确定性基准表现出脆弱的状态匹配、轨迹锁定、不正确的基本事实、基于子串的通信失败和奖励基础错位,而 LLM 判断基准则表现出评价规则漂移、幻觉完成、仅答案评分和大量的运行差异。在 LiveMCPBench 中,对同一设置进行 23 次重复评估,得出的分数从 57.9% 到 76.8% 不等,相差 18.9 个百分点,大到足以改变排行榜的结论。这些结果表明,当前的工具调用分数可以反映评估者的工件而不是代理的能力。我们引入了工具调用评估失败的统一分类法,发布了跟踪级审计工件和更正的评估组件,并主张单独衡量工具调用、任务完成和结果验证的分解指标。我们的研究结果表明,工具使用代理的进步需要基准,其评估者本身是可重复的、可审计的,并且与人类对任务成功的判断保持一致。我们进一步介绍了 Tool-Veritas,一个将确定性状态验证与可选定性判断相结合的可配置基准测试,以及 Harness Lab,一个用于基准测试执行、跟踪检查、重复运行比较和评估器调试的开源系统。