论文
SG-OPD:通过符号一致性门控和分阶段教师采样进行符号门控 同策略 蒸馏
SG-OPD: Sign-Gated On-Policy Distillation via Sign-Consistency Gating and Phased Teacher Sampling
摘要
同策略 蒸馏 (OPD) 通过更强大的教师对每个词元的密集监督,按照自己的轨迹训练学生,并且通常优于 离策略 蒸馏 和标准强化学习。然而,我们发现它的有效性隐含地依赖于两个在实践中经常被打破的假设:学生和教师之间的轨迹水平对齐,以及教师偏好的统一 词元级 可靠性。因此,我们提出符号门控 同策略 蒸馏 (SG-OPD),它使用二进制验证器作为教师在两个互补粒度上的信任信号:在冷启动时验证者认可的教师采样轨迹中分阶段进行教师采样混合,并且符号一致性门在教师同意验证者正确方向的情况下推断词元上的 蒸馏 更新并对其进行插值它不同意的地方。竞赛级数学推理基准实验表明,SG-OPD 始终优于标准 OPD,在每个样本和每个问题水平上的平均增益分别为 1.98 和 7.50。