论文

Harbor Adapters与Harbor-Index:大规模Agent评测基础设施与精选任务集

Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation

智能体系统Agent任务评测

摘要

在日益增长的智能体基准中评估智能体面临挑战,因为这些基准通常需要复杂的环境和智能体集成。我们提出了Harbor Adapters,一种统一的智能体基准评估基础设施。我们的工作做出三项贡献:首先,我们开发了基准适配器,将80多个基准迁移到可评估任意智能体的框架中,并通过严格的代码审查和一致性实验进行验证。其次,我们对8个模型(涵盖不同能力层级)在54个基准上进行了大规模评估,每个模型均使用Terminus-2和三种原生Harness之一进行测试,从而实现了对智能体能力与失败模式的更全面分析。第三,我们引入了Harbor-Index,一个精心筛选的82个难度高、多样且高质量任务的集合,涵盖29个基准,通过难度过滤、AI与人工审计以及审计-修复循环从适配套件中精炼而来。Harbor-Index在保持大规模智能体评估的挑战性与广度的同时,具备可运行的性价比;所有评估的模型-Harness配置通过率均不超过30%,最强模型(GPT-5.5搭配Codex)通过率为28.0%。我们开源了适配器、评估结果、深入分析和Harbor-Index,以支持语言模型智能体评估的更可靠和全面性。

Harbor Adapters与Harbor-Index:大规模Agent评测基础设施与精选任务集:论文配图
图 2:自发布以来的基准进展;我们评估的 54 个基准中的 39 个基准的最佳报告分数(按领域着色)。 “SWE”是软件工程的缩写。分数标准化为 [0,1][0,1],因此越高越好。浅色条表示我们评估中当前的最佳分数;轮廓条,出版时的最新技术。标有 * 的基准使用独立同分布 (i.i.d)。完整数据集的子集。发布和当前最佳分数来自基准论文、排行榜和模型报告(附录 F.3)。