论文
一对多,多对一:软件工程代理的类别感知迭代专家训练
One to More, More to One: Category-Aware Iterative Expert Training for Software Engineering Agents
摘要
存储库级软件工程(SWE)由异构任务类别组成,其在池代理强化学习下的进展可能不平衡:某些类别的收益与其他类别的回归一致,而聚合分辨率掩盖了这些变化。在这种类别拉锯的推动下,我们开发了一个类别感知的专家训练和政策整合框架。可执行任务构建和 SWE Labeler(一种基于证据的多轴标签系统)组织了训练池。初始特定类别的 RL 提高了平均训练成功率,同时留下了不均匀的实例级进度,从而激励成功行为和策略自适应任务选择的明确整合。同源类别专家将长视野 Agentic-miniRL 与刷新-修复-扩展 (RRE) 交替使用:更新的策略刷新实例掌握情况,重用其自己验证的成功轨迹进行修复 SFT,并重新选择任务以进行进一步的 RL。标签路由的多教师策略蒸馏 (MOPD) 将专家整合为一名可部署的学生,ReLU 门控奖励外推仅保留每位教师相对于参考的改进方向。专家训练和政策整合不需要外部模型来提供解决方案轨迹或行动目标。我们通过聚合和按类别分辨率、每个联合强化学习基线的最小类别提升以及专家增益恢复来评估池化强化学习和平衡强化学习、专家开发和单模型集成。最终的 MOPD 策略在 Pro-618 上实现了 58.04% 的平均分辨率,在 SWE-bench Multilingual 上实现了 59.00% 的平均分辨率,分别比基本模型提高了 5.39 和 2.78 个百分点。