论文
SCALER:面向推理的合成可扩展自适应学习环境
SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning
摘要
强化学习(RL)为提升大型语言模型的推理能力提供了一种有原则的方法,但其有效性取决于训练信号能否随模型演进而持续保持信息量。在实践中,当任务难度与模型能力错配,或训练被一小撮反复出现的问题模式主导时,RL的进展往往会放缓。为同时应对这两个问题,我们提出SCALER(Synthetic sCalable Adaptive Learning Environment for Reasoning),一个通过自适应环境设计来维持有效学习信号的框架。SCALER引入一条可扩展的合成流水线,将真实世界的编程问题转化为难度可控、实例生成无上限的可验证推理环境,使RL训练得以超越有限数据集,同时保持很强的正确性保证。在此基础上,SCALER进一步采用自适应多环境RL策略,动态调整实例难度并维护活跃的环境集合,以追踪模型的能力前沿并保持分布多样性。这种协同适应防止了奖励稀疏,缓解了对狭窄任务模式的过拟合,并支持在整个训练过程中持续改进。大量实验表明,SCALER在多个推理基准上持续优于基于数据集的RL基线,并表现出更稳定、更长程的训练动态。
