DiffGate:教师模型上策略蒸馏的困难门控教师模型指南
DiffGate: Difficulty-Gated Teacher Guidance for On-Policy Distillation
摘要
在策略蒸馏 (OPD) 已成为后训练大语言模型广泛使用的范例,通过监督学生模型自己生成的轨迹来减少传统蒸馏的训练-测试不匹配。然而,现有的 OPD 目标在很大程度上仍然是token本地的和结果不可知的,优化每个前缀的教师模型-学生模型协议,尽管推理质量是在轨迹级别确定的。具有可验证奖励的强化学习 (RLVR),特别是群体相关策略优化 (GRPO),提供了互补的结果级监督,但受到奖励稀疏和信用分配粗糙的影响。我们表明 OPD 和 RLVR 表现出互补的盲点:教师模型信号提供密集的局部指导,但与执行轨迹正确性的一致性较弱,而组相关奖励捕获任务成功率,但提供粗略的token级别的信用,并在所有失败组中消失。我们引入了 DiffGate,这是一种结果门控目标,它将 GRPO 与选择性、有界的教师模型指导相结合。 教师模型监督仅适用于失败的轨迹,按组难度进行缩放,并平滑限制以防止极端的教师模型-学生模型差异主导优化。因此,验证器确定哪些轨迹接收教师模型指导,而教师模型在这些轨迹内提供密集的token级更新方向。在 Qwen3-0.6B 和 Qwen3-1.7B 学生中,DiffGate 分别将代码 avg@8 比匹配的 GRPO 改进了 $+1.7$ 和 $+1.8$ 点,将 pass@8 改进了 $+1.6$ 和 $+5.7$ 点。在数学方面,avg@8 保持在 GRPO 的 $0.5$ 点以内,而 pass@8 则提高了 $+1.1$ 和 $+3.9$ 点。总体而言,DiffGate 改进了所有四个模型域设置中的 pass@8,展示了我们的评估协议下改进的解决方案覆盖范围。
