论文
AI智能体的高效基准测试
Efficient Benchmarking of AI Agents
摘要
在综合基准上评估AI智能体代价高昂,因为每次评估都需要包含工具使用与多步推理的交互式推演。我们研究小型任务子集能否以显著更低的成本保持智能体排名。与静态语言模型基准不同,智能体评估受到脚手架驱动的分布偏移影响,因为性能取决于包装底层模型的框架。跨八个基准、33个智能体脚手架与70余种模型配置,我们发现绝对分数预测在这种偏移下退化,而排序预测保持稳定。利用这种不对称性,我们提出一个简单的免优化协议:只在历史通过率处于中间区间(30-70%)的任务上评估新智能体。这一受项目反应理论(Item Response Theory)启发的中档难度过滤器将评估任务数量减少44-70%,同时在脚手架偏移与时间偏移下保持较高的排名保真度。它提供的排名比随机抽样更可靠(随机抽样在不同随机种子间方差很大),并且在分布偏移下优于贪心任务选择。这些结果表明,可靠的排行榜排名并不需要在完整基准上进行评估。
