论文
您只需要最少的 RLVR 训练:通过 Rank-1 轨迹推断 LLM
You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories
摘要
具有可验证奖励的强化学习 (RLVR) 已成为改善 大语言模型 (LLM) 推理的主导范例,但结果参数轨迹的基础几何结构仍未得到充分探索。在这项工作中,我们证明了 RLVR 权重轨迹的等级极低且高度可预测。具体来说,我们发现大部分下游性能增益是通过参数增量的 1 阶近似捕获的,其中该投影的大小随着训练步骤近乎线性地变化。受此启发,我们提出了一种简单且计算高效的方法 RELEX(强化学习外推),它从短观察窗口估计 1 级子空间,并通过线性回归推断未来的检查点,无需学习模型。在三个模型(即 Qwen2.5-Math-1.5B、Qwen3-4B-Base 和 Qwen3-8B-Base)中,RELEX 生成的检查点在域内和域外基准测试上均匹配或超过 RLVR 性能,仅需 15% 的完整 RLVR 训练步骤。值得注意的是,RELEX 能够在没有训练成本的情况下推断远远超出观察窗口的范围,预测检查点最多超出观察到的前缀 10-20$\times$,并持续改进(例如,仅观察前 50 个步骤并推断到 1000 个步骤)。我们的消融分析证实了 RELEX 的极简充分性:增加子空间等级或采用非线性建模都不会产生外推的进一步收益。最后,我们表明 RELEX 的成功源于“去噪”效应:通过将更新投影到 1 级子空间上,模型丢弃了随机优化噪声,否则这些噪声会在外推过程中降低性能。我们的代码可在 https://github.com/weizhepei/RELEX 获取。