论文

弱到强 同策略 蒸馏

Weak-to-Strong On-Policy Distillation

摘要

同策略 蒸馏 (OPD) 使学生与教师在学生自己的部署中的 词元级 分布保持一致,是跨 LLM 传输能力的有效范例。流行的方法假设教师至少与学生一样有能力:他们要么将较大的模型提炼为较小的模型,这在不存在较大教师的前沿会失败,要么整合从共享基础训练的多个领域专家,这需要在学生规模上进行昂贵的训练。我们引入从弱到强的 同策略 蒸馏 (W2S-OPD),这是一个简单而有效的 OPD 框架,它通过从多个弱模型中提取来提高强学生。 W2S-OPD 根据正负模型的对比对在 logits 空间中构造代理教师,该代理教师比学生小且获取成本低廉。它们的 logits 差异隔离了能力方向,该方向被添加到学生自己的基础模型中,产生一个代理教师,该代理教师耦合该方向,同时保持与学生的分布相邻。然后,学生通过在其自己的生成轨迹中最小化每个词元的反向 KL 来提炼它。我们将对比对实例化为 i) 强化学习后专家与其强化学习前初始化,隔离强化学习灌输的技能,ii) 较大的基础模型与较小的基础模型,将能力与规模隔离,以及 iii) 具有正确与错误提示的小型基础模型,隔离解决方案的实例级方向。在四个数学和三个代码基准测试中,W2S-OPD 优于 OPD,使学生能够超越领域教师,并且即使在每个监督源较弱的情况下也能不断提高学生。分析表明,不同的对比会产生不同的信号:强化学习后和提示对比强调推理框架,而尺度对比则强调解决过程。我们的代码将在 https://github.com/Yu-Fangxu/W2S-OPD 提供。