论文
Harbor Adapters与Harbor-Index:大规模Agent评测基础设施与精选任务集
Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation
摘要
在日益增长的智能体基准中评估智能体面临挑战,因为这些基准通常需要复杂的环境和智能体集成。我们提出了Harbor Adapters,一种统一的智能体基准评估基础设施。我们的工作做出三项贡献:首先,我们开发了基准适配器,将80多个基准迁移到可评估任意智能体的框架中,并通过严格的代码审查和一致性实验进行验证。其次,我们对8个模型(涵盖不同能力层级)在54个基准上进行了大规模评估,每个模型均使用Terminus-2和三种原生Harness之一进行测试,从而实现了对智能体能力与失败模式的更全面分析。第三,我们引入了Harbor-Index,一个精心筛选的82个难度高、多样且高质量任务的集合,涵盖29个基准,通过难度过滤、AI与人工审计以及审计-修复循环从适配套件中精炼而来。Harbor-Index在保持大规模智能体评估的挑战性与广度的同时,具备可运行的性价比;所有评估的模型-Harness配置通过率均不超过30%,最强模型(GPT-5.5搭配Codex)通过率为28.0%。我们开源了适配器、评估结果、深入分析和Harbor-Index,以支持语言模型智能体评估的更可靠和全面性。
