论文
ExpRL:LLM 中期训练的探索性强化学习
ExpRL: Exploratory RL for LLM Mid-Training
摘要
稀疏奖励强化学习 (RL) 已成为改进 LLM 推理的标准工具,但其成功主要取决于基础模型中的覆盖范围。在实践中,模型通常通过在策划的推理轨迹上进行\emph{训练中}来为强化学习做好准备,这些推理轨迹教授有用的原始技能,例如分解、验证或自我纠正。尽管有效,但该策略需要手动指定模型应该学习什么,并且尚不清楚这种原始覆盖范围是否足以解决更困难的问题,这需要将这些技能结合到更广泛的解决策略中。我们研究了一种更自动化的方法:\emph{基于强化学习的中期训练},使用大量人工编写的问答数据语料库。我们的方法 ExpRL 没有将参考解决方案视为模仿目标,而是将它们用作 \emph{奖励支架}:参考对策略隐藏,仅用于构建特定问题的评分标准来判断 同策略 推理痕迹。策略从原始问题提示中采样,而 LLM 法官将采样的推理轨迹与参考解决方案进行比较,并分配结果级别或过程级别的密集奖励。这让 ExpRL 能够强化部分进展、有用的中间缩减和富有成效的推理行为,而稀疏的最终答案奖励通常无法增加。在具有挑战性的数学推理任务上,ExpRL 产生比 SFT、稀疏奖励 GRPO 和 self-蒸馏 更强的 RL 启动,并为后续的稀疏奖励 RL 提供更好的初始化。其他混合域实验进一步表明 ExpRL 可以扩展到原始的纯数学设置之外。