论文

同策略 台达 蒸馏

On-Policy Delta Distillation

摘要

同策略 蒸馏 是强化学习中的另一种 后训练 方法,它通过从教师模型提供 词元级 监督来减轻奖励模型施加的约束。尽管 同策略 蒸馏 已在各种设置中进行了研究和应用,但其基本设计仍有待探索。在本文中,我们引入了一种新的 蒸馏 奖励,称为 delta 信号,而不是直接模仿教师的输出分布。增量信号被定义为在推理能力的指令调整之前教师模型与其基本模型之间的差异。因此,它捕获推理调整引起的变化,并为传递推理能力提供更直接的信号。使用大量的经验证据,我们表明增量信号显着改善了 同策略 蒸馏 并将新的 蒸馏 方法称为 同策略 Delta 蒸馏 (OPD$^2$)。数学、科学和代码推理基准测试的实验表明,OPD$^2$ 始终优于传统的 同策略 蒸馏,使得推理 LLM 只需很短的 后训练 周期即可实现强大的性能。代码将在 https://github.com/naver-ai/opd2 提供