论文

编码Agent强化学习能否迁移到不同基准与Harness

Cross-Benchmark Transfer from RL on Agentic Coding Tasks

模型训练强化学习RLVRAgentic RL

摘要

编码Agent经常在最后一英里失败:他们构建了大部分功能但放弃了需求,仅测试其实现已经处理的情况,破坏了应该保持完整的行为,或者根据未经检查的假设进行验证。我们询问专家构建的 Agentic 编码任务上的强化学习 (RL) 是否可以弥补这一差距,以及Agent学习的内容是否会超出训练分布。我们对 Kimi K2.7 代码进行后训练,这是一个 1T 参数(32B 主动)开放权重专家混合模型,仅使用 RL 来完成 1,700 个任务:1,000 个存储库任务通过隐藏的未通过测试和现有行为的通过测试进行评分,700 个终端任务由专家编写的隐藏验证器进行评分。奖励是通过的目标检查的分数,如果任何传递到传递测试失败,则奖励降至零。 32 级 LoRA 适配器上的 GSPO 的一个纪元在我们评估的六个外部基准中的每一个上都提高了 pass@1,跨越三个Agent工具:SWE-Bench Pro(60.1 至 64.8)、DeepSWE(31.0 至 43.4)、Terminal-Bench 2.1(67.4 至 82.0)、Terminal-Bench 3(1.4 至 12.1)、Terminal-Bench 4(0.0 至 7.6)和 SWE-马拉松(5.0 至 25.0)。汇集五个独立任务集(终端工作台 4 修改了终端工作台 3),改进非常显着(p < 0.001),并且在收集训练数据后发布的三个任务集上仍然显着(p = 0.004);该模型在训练中从未使用过的两种Harness下也得到了改进。 DeepSWE 和 Terminal-Bench 3 上的中位轨迹的智能体步数缩短了 24-35%。基础模型的 DeepSWE 运行失败大多是侥幸成功,并且在训练模型新解决的任务上,配对轨迹显示它避免了上述四种故障模式中的每一种。