论文
TeacherGRPO:先调整教师分布,再缩小推理蒸馏的能力差距
TeacherGRPO: Closing the Capacity Gap in Reasoning Distillation via Teacher Alignment
摘要
从强大的教师模型到较小的学生的推理升华面临着差距诅咒:随着教师变得更加成熟,他们的复杂分布越来越偏离学生可以近似的分布,从而导致性能下降。现有的缓解策略要么通过数据选择过滤掉具有挑战性的示例,要么引入较弱的中间辅助模型,本质上会损害监督覆盖范围或质量。我们提出了教师对齐,它直接使教师适应学生的分布,而不丢弃数据或降低推理质量。然而,通过标准知识蒸馏进行的幼稚调整会引发教师推理能力的灾难性崩溃。为了解决这个问题,我们将教师对齐重新表述为强化学习,并引入 TeacherGRPO,它建立在组相对策略优化的基础上,具有两项关键创新:(i)课程选择性对齐应用双标记和分布级别课程,将奖励集中在高信号推理差距上,同时过滤来自琐碎标记和不确定尾部分布的噪声;(ii)重要性自适应长度正则化有选择地惩罚冗长的冗余,同时保留教学上关键的推理步骤。然后,协调一致的教师通过标准管道向学生提炼知识。大量实验表明,TeacherGRPO 在各种推理基准和蒸馏方法上都显着优于基线。我们的代码可在 https://github.com/LzyFischer/TeacherGRPO. 获取