Envs-FORGE:针对代理 RL 的前沿优化奖励环境综合
Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL
摘要
终端代理的强化学习(RL)需要具有可靠奖励和有用难度的可执行训练环境。固定配方(例如少发、自我指导和进化指导)对每个种子应用相同的提示策略,即使当前的策略会从更难、更容易或完全不同的任务中受益。我们提出了 Envs-FORGE,这是一种将验证者奖励转换为每个种子环境综合操作的激励策略。 Envs-FORGE 估计种子通过率,对围绕目标学习前沿的六个投影方向操作进行评分,并求解每个种子的混合整数线性程序 (MILP) 以选择影响生成的操作。选定的动作驱动指令、fixture、oracle解决方案、测试和Docker环境的同步重写;只有经过标准参考验证的捆绑包才会进入 RL 训练。索引 MILP 表格还支持投资组合规划的可选软技能覆盖范围。在 Qwen 3.5 35B 上,Envs-FORGE 在 tb-core 上将 Pass@1 比 Base 提高了 9.2 个百分点(40.0% 到 49.2%),在 tb-2.0 上提高了 6.4 个百分点(23.0% 到 29.4%),比最强的固定配方基准提高了 2.4 和 2.1 个百分点。它在 SWE-bench Verified 上达到 77.1%,而 Base 为 73.4%,并且在评估的 4B--35B 模型中将 tb-core 提高了 6.8--9.2 点。所有综合方法都会导出 100 个经过验证的环境,并使用 2.27M--2.88M 综合词元,将比较放在相同的下游训练集大小和相同的操作规模上。源代码可在 https://github.com/DataArcTech/DataArc-SynData-Toolkit/ 获取。