论文
扩展强化学习真的需要更多训练吗?
Does Scaling Reinforcement Learning Really Require More Training?
摘要
扩展推理通常需要增加强化学习(RL)训练或推理阶段的计算。 我们表明,已完成的RL训练历史能够产生强于优化器实际经过的检查点的策略。我们称之为策略空间扩展:扩展可从固定的 RL 历史记录访问的可部署策略集,而不需要扩展训练或增加每个查询的推理计算。 我们以SURGE(通过特征空间融合无梯度扩展RL)实现这一思路。 SURGE组合来自同一次RL训练的两个检查点:高准确率的锚点,以及表现有竞争力且回答更短的供体。它将两个检查点表示为它们共享初始化的变化,然后对锚点的更新进行频谱分解以保留其主导成分并合并捐赠者的补充成分。通过保留多少锚更新的固定目标,SURGE 根据权重确定块大小,而无需测试候选策略。 我们评估DeepSeek和Nemotron两份1.5B数学推理训练历史,以及OLMo的一份7B代码训练历史。 SURGE的基准平均准确率高于两个输入检查点,同时推理词元少于锚点。在DeepSeek的AIME24评估中达到54.17%,而实测原始训练检查点最高为50.83%;在OLMo的HumanEval评估中达到83.7%以上,对照为82.8%。这些收益超出了观察到的训练曲线。 几何对照表明,RL更新结构的重要性不能仅由权重位移或词元减少解释。每个构建的模型都作为单个策略运行。我们的研究结果将存储的强化学习历史确定为可重用的扩展资源:训练过程中的可达能力不必止于最佳原始检查点。