论文
强化学习推理教师的迁移分层 在策略蒸馏
Transfer-Stratified On-Policy Distillation for RL-Improved Reasoning Teachers
摘要
强化学习可以显着改善推理教师模型,但尚不清楚当教师模型监督较小的 在策略学生模型时,哪些改进能够继续存在。我们通过比较 GRPO 前后的教师模型谱系、多个学生模型尺度、直接 GRPO 和几个策略蒸馏目标,在数学推理中研究这个问题。核心发现是,传输是结构化的而不是标量的:教师模型的强度本身并不能使密集蒸馏具有竞争力,而 RL 改进的教师模型会产生有用但依赖于度量的学生模型增益。这激发了传输分层 在策略蒸馏 (TS-OPD),它通过学生模型和教师模型的联合采样成功来筛选训练问题,将采集问题路由到门控正向 KL,将合并问题路由到门控反向 KL,并添加熵制动器以保护采样覆盖范围。在主要比较中,TS-OPD 是宏观平均正确性最强的学生模型目标,与 GRPO 改进的教师模型相比,而 pass@K 仍然更加混合。 消融表明收益来自路由和token选通而不是跳过问题。这些结果支持 OPD 的转移感知观点:当监督方向和token预算与学生模型的观察到的能力相匹配时,更强的教师会提供帮助,而不仅仅是因为教师模型端点更强。
