论文

DiffGate:教师模型上策略蒸馏的困难门控教师模型指南

DiffGate: Difficulty-Gated Teacher Guidance for On-Policy Distillation

摘要

在策略蒸馏 (OPD) 已成为后训练大语言模型广泛使用的范例,通过监督学生模型自己生成的轨迹来减少传统蒸馏的训练-测试不匹配。然而,现有的 OPD 目标在很大程度上仍然是token本地的和结果不可知的,优化每个前缀的教师模型-学生模型协议,尽管推理质量是在轨迹级别确定的。具有可验证奖励的强化学习 (RLVR),特别是群体相关策略优化 (GRPO),提供了互补的结果级监督,但受到奖励稀疏和信用分配粗糙的影响。我们表明 OPD 和 RLVR 表现出互补的盲点:教师模型信号提供密集的局部指导,但与执行轨迹正确性的一致性较弱,而组相关奖励捕获任务成功率,但提供粗略的token级别的信用,并在所有失败组中消失。我们引入了 DiffGate,这是一种结果门控目标,它将 GRPO 与选择性、有界的教师模型指导相结合。 教师模型监督仅适用于失败的轨迹,按组难度进行缩放,并平滑限制以防止极端的教师模型-学生模型差异主导优化。因此,验证器确定哪些轨迹接收教师模型指导,而教师模型在这些轨迹内提供密集的token级更新方向。在 Qwen3-0.6B 和 Qwen3-1.7B 学生中,DiffGate 分别将代码 avg@8 比匹配的 GRPO 改进了 $+1.7$ 和 $+1.8$ 点,将 pass@8 改进了 $+1.6$ 和 $+5.7$ 点。在数学方面,avg@8 保持在 GRPO 的 $0.5$ 点以内,而 pass@8 则提高了 $+1.1$ 和 $+3.9$ 点。总体而言,DiffGate 改进了所有四个模型域设置中的 pass@8,展示了我们的评估协议下改进的解决方案覆盖范围。

DiffGate:教师模型上策略蒸馏的困难门控教师模型指南的原论文方法或结果图
图 2:DiffGate 概述。 学生模型生成策略上的轨迹,该轨迹接收来自验证者的序列级正确性反馈和来自冻结的教师模型的token级指导。 DiffGate 限制了采样的token教师模型–学生模型对数概率差距,仅将教师模型指导应用于失败的轨迹,并根据组求解率缩放其强度。由此产生的token级优势将本地教师模型指导与全局 GRPO 结果信号相结合,以更新学生模型策略。详细信息请参见算法 1。