论文

向前训练,向后蒸馏:引导大语言模型的on-policy自蒸馏

Train Ahead, Distill Back: Bootstrapping On-Policy Self-Distillation for Large Language Models

摘要

策略自蒸馏(OPSD)通过让拥有特权信息的自学者对模型自身的轨迹提供密集的词元级监督来改进大语言模型。然而,现有的方法通常根据当前、初始或缓慢平均的政策状态构建自学教师,从而使监督质量受到教师利用特权信息的能力的限制。我们询问是否可以将模型自身的优化进度回收为更强大的自教师。在本文中,我们引入了 Bootstrapped On-Policy Self-Distillation (B-OPSD),它临时训练前面的策略以获得未来的教师,将学生恢复到原始的策略状态,然后使用未来的教师来监督重新启动的学生。未来的老师以两种互补的方式改进监督,它可以生成更可靠的特权轨迹,并以它们为条件,沿着重新启动的学生的政策轨迹提供更多信息的词元级目标。使用 Qwen3-4B 和 Qwen3-8B 进行的数学推理实验表明,在两种设置中,与标准 OPSD 相比都有一致的改进,包括在rollout特权设置中从 27.50 提高到 41.30,从 48.80 提高到 64.44。我们的研究结果指出了自我改进模型的一个更广泛的原则,即未来的学习进度可以向后提炼,保留所获得的知识,同时引导超越产生它的优化状态。