论文

GAGAR:按实现质量重分配代码Agent的强化学习优势

Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL

模型训练强化学习RLVRAgentic RL

摘要

代码Agent的强化学习 (RL) 通常使用可执行测试来提供二进制奖励。通过这些奖励,组相对策略优化 (GRPO) 为每个rollout组内的测试通过轨迹分配相同的优势,而忽略了实施质量和遵守任务要求方面的差异。这使得该策略没有一个学习信号,即有利于干净、有针对性的实施,而不是那些包含不必要或超出范围的变化的策略。我们引入了 GAGAR,一个在代码Agent RL 中进行质量感知信用重新分配的框架。 GAGAR 基于动态采样,保留包含通过和失败轨迹的组,将每个组的所有轨迹放置在共享工作区中,其中受过 SFT 训练的 agentic 评分者联合检查它们并对通过测试的候选者进行排名。基于这个排名,我们降低排名较低的轨迹的权重,并按比例重新调整所有通过测试的轨迹的优势,以恢复其原始总和。这种保和再分配保留了基于质量的降权所建立的相对权重,同时将信贷转向更高质量的实施。我们使用 MiMo-V2.6-Flash(总参数 310B)和 MiMo-V2.6-Pro(总参数 1.02T)的 RL SFT 前检查点在工业规模上评估 GAGAR。受控的纯代码 Flash 实验表明,代码Agent性能得到改善,轨迹长度增长减少,训练更稳定。我们进一步将 GAGAR 应用于 Flash 和 Pro 的大规模混合任务强化学习中。我们的结果支持将基于测试的验证与分组 agentic 分级相结合,以提高代码Agent RL 的质量和稳定性。