论文
深入研究利用合成数据和课程扩展强化学习以生成代码
A Deep Dive into Scaling RL for Code Generation with Synthetic Data and Curricula
摘要
强化学习 (RL) 已成为改进 大语言模型 超越监督 微调 的强大范例,但维持大规模性能提升仍然是一个开放的挑战,因为数据多样性和结构(而不仅仅是数据量)成为限制因素。我们通过引入可扩展的多轮合成数据生成管道来解决这个问题,其中教师模型根据上下文中的学生表现摘要迭代地完善问题,从而在没有任何教师 微调 的情况下产生结构化的难度进展。与单轮生成相比,这种多轮方法大大提高了有效综合问题的产量,并自然地产生垫脚石,即同一核心任务的更简单和更难的变体,支持基于课程的训练。我们系统地研究了 Llama3.1-8B Instruct 和 Qwen3-8B Base 模型系列的 RL 训练期间任务难度、课程安排和环境多样性如何相互作用,并在 Qwen2.5-32B 上进行了额外的扩展实验。我们的结果表明,综合增强持续改善了域内代码,并且在大多数情况下改善了域外数学表现,并且我们提供了关于课程设计和数据多样性如何共同塑造 RL 训练动态的实证见解。