论文
从预训练到 后训练 理解推理
Understanding Reasoning from Pretraining to Post-Training
摘要
强化学习 (RL) 已成为在复杂推理任务上改进 大语言模型 (LLM) 的核心,但 RL 后训练 在很大程度上是与之前的预训练隔离开来进行研究的。因此,两个基本问题仍然悬而未决:(1) 预训练选择(模型大小、数据)如何影响 RL 计算的回报,以及 (2) RL 实际上对模型做了什么?这些问题在标准 LLM 设置中很难研究:预训练语料库庞大且不受控制,因此很难将行为归因于预训练与强化学习,并且跨两个阶段的系统计算扫描成本高昂。为了应对这些挑战,我们使用国际象棋作为受控测试平台来研究整个预训练到 后训练 管道的推理。我们遵循标准 LLM 训练流程,在人类国际象棋游戏上预训练 5M 到 1B 参数的语言模型,在合成推理轨迹上监督 微调,并在具有可验证奖励的国际象棋谜题上运行 RL。使用这个框架,我们发现给定 RL 计算级别的 RL 后性能可以根据预训练损失得到很好的预测,并且 RL 奖励曲线的斜率随着预训练标记的增加而近似线性提高。除了扩展之外,我们发现强化学习并不仅仅简化了 SFT 策略:在简单的谜题上,它放大了 SFT 策略已经首选的正确动作,而在困难的谜题上,它呈现了 SFT 下几乎不存在的正确动作。我们通过在数学领域文本上训练 1B 语言模型来进一步测试我们的发现是否超越了国际象棋,其中出现了相同的预测模式:较长的预训练检查点达到更高的强化学习后性能,并在强化学习下提高得更快。总之,我们提供了预训练到 RL 接口的定量说明和受控测试台,用于研究整个预训练到 后训练 管道的推理科学。