论文

Messier:用于跨基准智能体评估的高分辨率语料库

Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation

模型评测基准与评测资源

摘要

由于任务、脚手架、验证器与评分规则彼此割裂,跨交互环境全面评估AI智能体十分困难。遗憾的是,现有的统一评估工作在规模与领域上有限,导致必须付出高昂代价重新运行,且已有数据无法相互比较。我们提出MESSIER,一个包含957,611条记录的统一语料库,覆盖30个基准、745个智能体、11,891个任务与74,263个验证器。MESSIER将公开评估结果与在六个代表性不足的专业及科学基准上的新运行相结合,把其异构组件标准化为统一模式。利用该语料库,我们表明前沿进展在各基准组之间并不均衡:函数调用评估已基本饱和,编程改进最快,而企业工作流仍最具挑战性。反事实重评分进一步表明,多验证器任务中的严格全通过评分可能改变智能体排名。最后,我们从语料库中导出能力分数,其与Epoch的评估能力指数排名的相关性达到Spearman ρ = 0.84。这些分数还可针对按领域、职业、动作空间或验证器类型定义的子集进行估计。从本质上说,MESSIER是大规模研究智能体性能的可复用资源,也是设计更优评估的基础。