论文

CodeMidas:从源代码本身扩展Agentic编码RL环境

CodeMidas: Scaling Agentic Coding RL Environments from Code Itself

模型训练强化学习合成数据RLVRAgentic RL

摘要

通过强化学习(RL)训练强大的编码Agent需要带有可靠验证器的多样任务。开源代码库是此类任务的丰富来源,而现有方法通常依赖issue与提交等开发工件,限制了可提取任务的范围。为更好地扩展RL环境,我们提出CodeMidas——一个Agentic流水线,仅以源代码为任务相关输入,将现有代码库中已实现的功能转化为可执行的RL环境。CodeMidas将Agentic算力分配到环境构建的每个阶段:Agent探索已实现的功能以形成行为规范,基于原始代码的执行构建测试,并通过执行检查与重复解题回合验证和筛选候选任务。所得数据集包含来自3185个开源代码库的5545个训练任务,覆盖23种编程语言与15个技术领域。用GRPO在这些任务上训练MiMo-V2.5,在全部五个多样基准上均有提升,涵盖issue修复(DeepSWE +11.7%)、整程序构建(ProgramBench +17%)与终端工作(Terminal-Bench v2.1 +8.5%)。消融显示,增加高质量训练任务数量可提升性能。轨迹分析表明,经RL训练的Agent展现出更好的行为,如更多代码库探索与更多样的自我验证。这些结果确立了源代码作为构建RL环境的可扩展基础,能改进编码Agent在多样软件任务上的表现。