论文

SCALER:面向推理的合成可扩展自适应学习环境

SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning

模型训练强化学习

摘要

强化学习(RL)为提升大型语言模型的推理能力提供了一种有原则的方法,但其有效性取决于训练信号能否随模型演进而持续保持信息量。在实践中,当任务难度与模型能力错配,或训练被一小撮反复出现的问题模式主导时,RL的进展往往会放缓。为同时应对这两个问题,我们提出SCALER(Synthetic sCalable Adaptive Learning Environment for Reasoning),一个通过自适应环境设计来维持有效学习信号的框架。SCALER引入一条可扩展的合成流水线,将真实世界的编程问题转化为难度可控、实例生成无上限的可验证推理环境,使RL训练得以超越有限数据集,同时保持很强的正确性保证。在此基础上,SCALER进一步采用自适应多环境RL策略,动态调整实例难度并维护活跃的环境集合,以追踪模型的能力前沿并保持分布多样性。这种协同适应防止了奖励稀疏,缓解了对狭窄任务模式的过拟合,并支持在整个训练过程中持续改进。大量实验表明,SCALER在多个推理基准上持续优于基于数据集的RL基线,并表现出更稳定、更长程的训练动态。

SCALER:面向推理的合成可扩展自适应学习环境 配图
图 1:SCALER 的一个示意性训练示例。模型与一组活跃环境交互:实例用于训练,在线准确率更新环境内的难度控制器,而学习信号趋于饱和的环境会被退役,并通过策展机制替换为新环境。