论文

PACE:智能体能力评估的代理基准

PACE: A Proxy for Agentic Capability Evaluation

模型评测评测方法与指标

摘要

在SWE-Bench与GAIA等基准上评估LLM智能体可能昂贵、耗时且需要复杂基础设施。单次评估可能花费数千美元并需数天完成。相比之下,测试单点能力(如推理、代码生成)的非智能体LLM基准运行快速且便宜。本文研究:昂贵智能体基准上的性能能否由小型、精心选择的原子评估实例子集上的性能准确预测。我们提出PACE——一个通过从既有非智能体评估中选择实例构建代理基准的框架——所选实例的聚合分数最可靠地预测模型在智能体基准上的表现。给定横跨原子能力的候选实例池,PACE拟合一个回归——将模型在紧凑源实例子集上的分数映射到其在目标智能体基准上的分数。该子集本身结合两种互补的实例选择策略策展:目标相关的局部选择与全局信息性的全局选择。我们将PACE应用于本文4个目标智能体基准——产出PACE-Bench——我们在论文中评估的具体代理基准。跨14个模型、4个智能体基准与19个非智能体基准的实验表明:PACE-Bench预测智能体分数的留一交叉验证(LOOCV)平均绝对误差低于4%——Spearman相关高于0.80——成对模型排序准确率约85%——全部以远低于完整智能体评估1%的成本。我们进一步分析选中的代理实例——揭示每个智能体基准独特需求的技能。PACE使从业者在模型开发、选择与路由期间无需完整智能体评估开销即可获得可靠的智能体性能估计。

PACE:智能体能力评估的代理基准:论文配图
图 3:从覆盖每种能力的源基准中选择的实例总数,四个代理目标中的 C=100C=100(缩写遵循表 1)。