超越 GRPO 和 同策略 蒸馏:语言模型 后训练 的经验稀疏到密集奖励原则
Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training
摘要
在标记的可验证训练数据是约束约束的设置中,每个检查的示例都应分配给信息最丰富的模型和奖励密度。我们确定了控制这种分配的奖励密度原则:稀疏序列级奖励对于可以探索和发现更好行为的模型最有用,而密集的 词元级 教师监督更适合将该行为压缩到更小的部署模型中。该原则产生了一个简单的分配规则:在上游使用最强大的可用教师的稀缺标记数据,然后将奖励形状的行为转移到下游作为密集监督。我们通过四阶段工作流程(教师 RL、前向 KL 热身、同策略 蒸馏、可选的桥后学生 RL)以及 Qwen3 和 Llama 模型的可验证数学来评估此规则。在固定的 Qwen3-1.7B 部署学生规模下,通过密集桥提取的 RL 改进的 8B 教师在同一学生上的表现优于直接 GRPO(数学上 $79.3\%$ vs.\ $75.9\%$;AIME~2024 上 $25.2\%$ vs.\ $19.8\%$,avg@16),同时从同一名教师转移\emph{之前} RL 表现不佳。组件消融确认每个阶段都是承重的:用原始教师替换 RL 改进的教师需要花费 7.8 美元的数学点,移除前向 KL 预热的成本为 1.7 美元,移除 同策略 蒸馏 的成本为 3.3 美元。教师质量排序——原始教师传输 $<$ 直接 GRPO $<$ RL 教师传输——在 Llama-3.1-8B-Instruct 上与 Llama-3.3-70B-Instruct 教师进行复制。操作经验是避免将稀缺的标记数据花费在最不准备的策略上:对教师端发现使用稀疏奖励,对学生压缩使用密集传输,仅在桥接之后使用学生端稀疏奖励。