论文

AI智能体的高效基准测试

Efficient Benchmarking of AI Agents

模型评测智能体系统Agent Harness评测方法与指标

摘要

在综合基准上评估AI智能体代价高昂,因为每次评估都需要包含工具使用与多步推理的交互式推演。我们研究小型任务子集能否以显著更低的成本保持智能体排名。与静态语言模型基准不同,智能体评估受到脚手架驱动的分布偏移影响,因为性能取决于包装底层模型的框架。跨八个基准、33个智能体脚手架与70余种模型配置,我们发现绝对分数预测在这种偏移下退化,而排序预测保持稳定。利用这种不对称性,我们提出一个简单的免优化协议:只在历史通过率处于中间区间(30-70%)的任务上评估新智能体。这一受项目反应理论(Item Response Theory)启发的中档难度过滤器将评估任务数量减少44-70%,同时在脚手架偏移与时间偏移下保持较高的排名保真度。它提供的排名比随机抽样更可靠(随机抽样在不同随机种子间方差很大),并且在分布偏移下优于贪心任务选择。这些结果表明,可靠的排行榜排名并不需要在完整基准上进行评估。

AI智能体的高效基准测试:论文配图
图 6:任务选择策略 ×\times 基准(跨协议的平均值 ρ\rho)。每个单元格显示跨评估方案的平均 Spearman ρ\rho;最坏情况 ρ\rho 如下以灰色显示。星号标记了每个基准中表现最佳的策略。