论文
强化学习如何重塑LLM推理:可转移性、覆盖率和缩放定律
How RL Reshapes LLM Reasoning: Transferability, Coverage, and Scaling Laws
摘要
最近关于强化学习 (RL) 的研究报告了关于大语言模型 (LLM) 推理的看似相互矛盾的证据。数学上的训练可以提高其他领域的性能,但 Pass@1 的增益可以与比基本模型更低的 Pass@$N$ 相一致。这就提出了一个基本问题:强化学习是扩展LLM的推理边界,还是仅仅重新衡量其现有的推理空间?我们重新审视 Qwen 和 Gemma 模型系列中的这些现象,显示出跨领域的增益和遗忘,而大样本预算的覆盖范围在某些任务上增加,而在其他任务上减少。对 RL 前后解决方案轨迹的详细分析表明模型采用的推理策略发生了变化,从而激发了两阶段自回归策略模型,该模型将 emph{策略选择} 与特定问题的执行分开。在此框架内,我们证明了强化学习的隐性偏差如何重塑策略偏好,从而在某些任务上获得收益,同时抑制其他任务所需的策略。即使没有扩大策略支持,该机制也可以在给定的抽样预算下扩大或缩小覆盖范围。我们进一步为 RL 计算中的对数 sigmoid 和对数线性缩放定律提供理论依据,并评估它们的预测能力。总之,这些结果将策略选择的变化与跨域传输、推理覆盖和计算扩展联系起来。