论文
前缀引导 同策略 蒸馏:从采样轨迹中挖掘高质量轨迹
Prefix-Guided On-Policy Distillation: Mining Golden Trajectories from Rollouts
摘要
同策略 蒸馏 (OPD) 通过对学生采样轨迹应用密集的教师监督来改进推理模型。然而,将 OPD 扩展到长期推理会暴露出可靠性和效率问题:标准 OPD 为每个候选人分配相同的长轨迹采样预算,尽管某些轨迹可能很快就会与教师变得较弱,并提供不太有用的监督。先前的分析表明,教师与学生的兼容性对于 OPD 的成功非常重要,可以激发早期前缀 top-k 重叠作为延续价值的代理。持续低重叠轨迹到整个采样轨迹长度可能会导致它们随着生成的进行而远离教师,增加计算成本,同时提供有限的 蒸馏 好处。为了解决这个问题,我们引入了 Prefix-Guided 同策略 蒸馏 (PG-OPD),这是一个转出分配框架,可根据固定长度前缀估计连续值。 PG-OPD 在早期探测窗口中计算教师与学生的 top-k 重叠,并仅将长的 rollout 分配给高重叠的候选者,同时在前缀长度处停止其余的。在 AMC、AIME 和 HMMT 基准测试中的师生组合中,PG-OPD 在不同配置中实现了高达 4.80 点的精度增益和高达 2.46 倍的挂钟加速。这些结果表明,使用早期前缀兼容性来指导候选修剪可以提高训练效率和推理性能。