可验证的环境是乐高积木:用于推理泛化的递归组合
Verifiable Environments Are LEGO Bricks: Recursive Composition for Reasoning Generalization
摘要
具有可验证环境的强化学习(RL)已成为增强 大语言模型(LLM)推理能力的强大方法。虽然先前的研究表明,缩放环境数量可以提高 RL 性能,但现有的手动或单独的构建方法受到线性缩放限制,从而阻碍了可扩展推理泛化。本文介绍了 RACES(\textbf{R}ecursive \textbf{A}utomated \textbf{C}omposition for \textbf{E}nvironment \textbf{S}caling),该框架将可验证环境概念化为可以递归组装的可组合构建块。关键的见解是,当一个环境的共域(输出类型)与另一个环境的域(输入类型)匹配时,它们可以自动融合到新的可验证环境中,从而实现递归组合。 RACES 通过 300 个单独的环境实现,并定义了一组组合运算符(\textsc{SEQUENTIAL}、\textsc{PARALLEL}、\textsc{SORT} 和 \textsc{SELECT}),这些运算符可引发不同的推理模式。大量实验表明,在这些复合环境上进行强化学习训练可以持续增强推理泛化能力。具体来说,RACES 在六个基准测试中将 DeepSeek-R1-Distill-Qwen-14B 平均提高了 3.1 分(从 48.2 提高到 51.3),并将 Qwen3-14B 的性能从 58.8 提高到 61.1,这在训练环境的构建过程中是看不到的。此外,RACES 的性能可与仅使用 50 个基础环境在 300 个单独环境上进行的训练相媲美,证明了环境利用率的显着效率。