论文

组合合成:通过原子分解和重组缩放代码 RLVR

Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination

模型训练合成数据

摘要

最近,具有可验证奖励的强化学习(RLVR)成为塑造 大语言模型(LLM)卓越编码能力的基石。然而,RLVR 的可扩展性受到缺乏足够具有挑战性的可验证代码任务的严重限制,这些任务的目标接近模型的能力边缘。先前的研究通常依赖于启发式种子扩展来进行数据合成,这严重限制了新颖性和难度。因此,此类数据的训练价值无法与其合成的规模成比例地缩放。为此,我们提出了原子分解和重组(ADR),这是一种新颖的框架,通过分解为原子元素和受控重组来生成可验证的代码任务,从而能够生成真正新颖且具有挑战性的可验证代码任务。实验和分析表明,ADR 在现有基线上实现了卓越的原创性、难度、多样性和测试质量,并持续在不同下游领域(包括算法编程、工具使用和数据科学)的 RLVR 中实现代码能力的更大改进。我们的工作揭示了新颖的代码任务合成和可扩展 RLVR 训练的新范例。