论文

在后训练前预测编码Agent表现:基础模型的动作筛查

Before They Can Solve: Predicting Post-Training Coding-Agent Performance from Base Models

模型评测智能体系统应用与实践Agent任务评测评测方法与指标编程

摘要

我们如何预测哪个基础检查点值得进行一轮昂贵的 Agentic 训练后?端到端 pass@$K$ 测试成功的行为是否已出现在基本模型的分布中,但它不太适合 Agentic 编码:许多基本检查点无法可靠地生成端到端完成任务所需的格式良好的工具调用。单次或短期任务通过将多步骤交互压缩为固定提示和单个补丁来避免这些工具调用失败,但它们回避了我们关心的核心功能:随着存储库的发展,在许多工具使用步骤上保持一致的状态。为了弥补这一差距,我们将成功的训练后智能体轨迹视为基础模型潜力的前瞻信号。在每个代码更改步骤之后重放每个轨迹并重新运行测试确定了决定性的步骤:累积补丁将存储库从失败翻转为通过的第一步,证明记录的操作解决了给定先前上下文的任务。受 Agentic 跟踪覆盖原则的启发,我们在此步骤构建了三个屏幕,不需要基本检查点即可从冷启动驱动Harness:(i) 决定性操作 BPB(每字节位数)测量认证操作的概率质量,(ii) 补丁 MCQ 测试检查点在该操作和被同一验证者拒绝的替代方案之间的选择,以及 (iii) 前缀条件 pass@$K$ 评估对功能正确的生成并归功于测试接受的任何延续。在十对公共基础和训练后模型中,所有三个屏幕对队列的排名与训练后 SWE-bench Verified pass@$1$ 非常一致。由于我们的方法只需要基准的成功轨迹及其验证器,因此可以应用它们将未来的 Agentic 编码基准转化为基本模型评估。

在后训练前预测编码Agent表现:基础模型的动作筛查:论文原图
图 1:统一的 Agentic 轨迹衍生探测框架。通过针对任务自己的验证者 VV 重放编码任务上的编码Agent轨迹,我们找到了决定性步骤 T⋆T^{\star},即其累积补丁解决任务的最早步骤。在这个决定性步骤中,(i) Decisive-Action BPB 测量基本模型分配给黄金操作的字节归一化可能性; (ii) 补丁 MCQ 评估基础模型区分黄金行动与非解决替代方案的能力; (iii) 前缀条件 pass@K\mathrm{pass@}K 测量基本模型在采样下的经验成功率:它从 T⋆T^{\star} 中提取 KK 连续,并让任务自己的验证者 VV 判断它们。