论文
SFT 过度训练通过 RLVR 下的熵崩溃预测排名反转
SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR
摘要
当 SFT 压缩 rollout 分布时,为 GRPO 选择具有最高 pass@1 的 SFT 检查点的标准启发式可能会失败。对于二元奖励,组内优势方差的预期为 $p(1{-}p)(g{-}1)/g$;当早期 GRPO 使 $p$ 低于 $p^*(g)$ 时,大多数群体具有相同的奖励并且不提供群体相关信号。我们研究了 Qwen2.5-Coder-3B 和 DeepSeek-Coder-6.7B 的 SFT 深度阶梯。我们在五个深度和三个种子上测试 Qwen2.5-Coder-3B,在四个匹配深度和三个种子上测试 DeepSeek-Coder-6.7B。在 Qwen 上,RL pass@1 前随着 SFT 深度的增加而上升,但 GRPO pass@10 的峰值从 $0.806$ 下降到 $0.481$(3 颗种子的平均值,$n{=}20$); RL 前熵与 GRPO 结果正相关 ($ρ{=}{+}0.69$)。在 DeepSeek 上,pass@1 仍然远高于 $p^*(8){=}0.083$,并且 GRPO 结果是压缩而不是反转。两阶段诊断将预 RL 熵分类与早期 GRPO 熵监视器相结合,标记高风险检查点,并可以尽早停止失败的运行。简单的 KL 引用正则化和标签平滑变体并不能挽救我们设置中崩溃的 Qwen 检查点,这表明失败不是一个微不足道的 GRPO 超参数假象。