论文

预训练 期间的 RL 偏移:重新检查 LLM 训练的策略优化

RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training

模型训练强化学习

摘要

标准 LLM 训练管道仅在 预训练 和监督 微调 (SFT) 之后应用强化学习 (RL)。我们通过从头开始训练 LLM 并应用 RL、SFT 和 SFT,然后将 RL 直接应用到中间 预训练 检查点来质疑这一现状。我们发现 RL 很早就有效,并且通常也很早就匹配完整的 SFT$\to$RL 管道。通过对较难问题的实验,我们发现有针对性的 预训练 数据组合是增强 RL 有效性的强大杠杆,甚至比模型规模更有效。除了推理准确性之外,直接将强化学习应用于基本检查点还可以扩展模型的分布;最近的工作中报告的锐化效应仅在 RL 遵循 SFT 时才会出现。强化学习后,模型的一般能力基本上保持不变,但在 SFT 后,它们的性能会下降。最后,我们通过并行平均合并 RL 和 SFT 目标,这种方法在指标方面优于所讨论的所有其他训练方法,同时保留了一般功能。总之,这些结果表明 LLM 训练可能会受益于 RL 的扩大使用。