技术实践

Anthropic 工程团队量化基础设施配置对 Agent 编码评测的噪声

智能体系统AI 基础设施Agent任务评测Sandbox长程任务评测Agent Sandbox

概述

Anthropic 工程团队发文指出,Agent 编码基准的成绩常被视为模型能力的精确度量,但运行环境的资源配置本身就可能造成超过榜单差距的波动。团队在 Google Kubernetes Engine 集群上运行 Terminal-Bench 2.0 时,发现成绩与官方榜单不符,且容器故障率高:多达 6% 的任务因 pod 错误失败,多数与模型能力无关。原因在于资源限制的执行方式:把每任务资源规格同时当作保底与硬上限时,容器一旦瞬时超限即被杀掉;榜单所用沙箱则允许临时超额。为量化影响,团队在保持模型、评测框架与任务集不变的前提下,测试了从严格限制到完全放开共六档资源配置。结果显示成功率随资源余量上升:基础设施错误率从严格限制下的 5.8% 单调降到完全放开时的 0.5%;1x 到 3x 之间成绩波动在噪声范围内(p=0.40);3x 以上成功率升幅开始超过错误率降幅;资源最充裕与最紧张配置间的差距达 6 个百分点(p<0.01),可超过头部模型的榜单分差。这是实验性研究,提示对比模型成绩时须对齐或披露运行环境配置。