论文

强化学习推理教师的迁移分层 在策略蒸馏

Transfer-Stratified On-Policy Distillation for RL-Improved Reasoning Teachers

摘要

强化学习可以显着改善推理教师模型,但尚不清楚当教师模型监督较小的 在策略学生模型时,哪些改进能够继续存在。我们通过比较 GRPO 前后的教师模型谱系、多个学生模型尺度、直接 GRPO 和几个策略蒸馏目标,在数学推理中研究这个问题。核心发现是,传输是结构化的而不是标量的:教师模型的强度本身并不能使密集蒸馏具有竞争力,而 RL 改进的教师模型会产生有用但依赖于度量的学生模型增益。这激发了传输分层 在策略蒸馏 (TS-OPD),它通过学生模型和教师模型的联合采样成功来筛选训练问题,将采集问题路由到门控正向 KL,将合并问题路由到门控反向 KL,并添加熵制动器以保护采样覆盖范围。在主要比较中,TS-OPD 是宏观平均正确性最强的学生模型目标,与 GRPO 改进的教师模型相比,而 pass@K 仍然更加混合。 消融表明收益来自路由和token选通而不是跳过问题。这些结果支持 OPD 的转移感知观点:当监督方向和token预算与学生模型的观察到的能力相匹配时,更强的教师会提供帮助,而不仅仅是因为教师模型端点更强。

强化学习推理教师的迁移分层 在策略蒸馏的原论文方法或结果图
图 1:转移差距概述及其问题级分解。左:GRPO 产生教师模型改进 $\Delta T$,但标准 OPD 仅将其一部分传输到学生模型增益 $\Delta S$,留下 $\Delta T-\Delta S$ 的传输间隙。中:联合教师模型–学生模型通过率确定知识差距(教师模型 $>0$、学生模型 $=0$)、精度差距(教师模型 $>$ 学生模型 $>0$)以及不可转移的教师模型问题优势(教师模型 $\leq$ 学生模型)。右图:TS-OPD 将这三个层分别路由到匹配的操作——发现、细化和跳过。