论文
DCE+SRCL:动态教师自蒸馏与已验证简洁改写
Recursive Self-Improvement via On-Policy Distillation for Reasoning
摘要
同策略蒸馏 (OPD) 通过生成轨迹来训练学生模型,然后将其下一个词元预测与外部教师的下一个词元预测进行匹配。这为学生提供了密集的、token级监督。同策略自蒸馏 (OPSD) 消除了对外部教师的需要。具体来说,学生模型的第二个冻结副本现在在其上下文中给出了基本事实,充当教师。学生模型仅接收问题并学习模仿特权教师模型,而教师在整个训练过程中保持冻结状态。之前的工作表明,冻结教师对于训练稳定性很有用,但我们认为这会阻止教师纳入学生在训练过程中学到的改进。我们的主要贡献是通过围绕两个互补组件构建的递归框架来解决这一限制。首先,我们让特权教师与学生共同进化,以便一轮中学到的修订可以指导下一轮,我们将这一过程称为动态共同进化(DCE)。其次,由于更强的修订也会使响应过于冗长和自我批评,因此我们还对模型自身的同策略生成的响应进行更短的、经过验证的重写进行训练。我们将这一补充目标称为“自我完善简明学习”(SRCL)。总体而言,我们的综合评估表明,DCE+SRCL 在多个模型尺度和四个竞赛级数学基准上优于 OPSD。具体来说,在 Qwen3-8B 上,DCE+SRCL 达到 65.97% Average@12,比 OPSD 好 35.62 个百分点,同时相对于单独 DCE 减少平均输出长度 7.80%。