论文

PluginEval:函数调用细粒度错误归因的诊断性基准

PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling

模型评测基准与评测资源

摘要

随着大语言模型日益作为自主智能体运行,工具路由的可靠评估至关重要。现有基准面临三个结构性局限:幂律分布的数据使罕见场景代表性不足;缺乏对抗性困难负例,掩盖模型间性能差异;标注流水线依赖未经执行验证的LLM判断。本文提出PluginEval,一个通过两阶段框架构建、系统缓解这些局限的基准。首先,我们把工具路由表述为三个决策的序列,并将生成与验证分离。大语言模型提出候选调用,确定性校验与真实API执行提供可靠质量信号。其次,我们按能力、意图与边界分解每个插件,识别触发与排除场景。然后生成不同难度的查询填补覆盖缺口,包括针对三种失败模式的对抗性负例,并将其返回第一阶段标注。该过程形成闭环,迭代直至覆盖收敛。在评估上,我们超越总体准确率。以金标准标注锚定的LLM裁判将失败归类为漏调、误调或参数错误,为每个模型生成细粒度错误画像。我们评估五个模型家族(包括专有模型与开放权重模型),分析其在难度级别与错误类别上的表现,并通过与人工标注的一致性验证该裁判。

PluginEval:函数调用细粒度错误归因的诊断性基准:论文配图
图1:细粒度函数调用评估的动机:聚合分数掩盖了不同的失败模式。