论文

同策略 蒸馏 是否需要全面轨迹采样?

Are Full Rollouts Necessary for On-Policy Distillation?

摘要

同策略 蒸馏 (OPD) 沿着学生生成的轨迹采样提供密集的教师反馈,而不是固定的教师跟踪,并已成为一种有前途的 后训练 范例。然而,标准 OPD 通常在训练期间生成完整的轨迹采样,这在计算上是昂贵的,并且可能使学生在后期轨迹采样位置时接触到不可靠的教师反馈,尤其是在早期训练期间。我们认为轨迹采样范围是 OPD 的一个关键瓶颈,它会严重影响训练效率。与可验证奖励的强化学习(RLVR)不同,OPD 不需要最终答案奖励来提供学习信号。因此,对于 OPD 来说,全面轨迹采样可能并不总是必要的。受此启发,我们提出了两种简单的水平控制策略:渐进式 OPD (POPD),在训练期间逐渐扩大轨迹采样范围;截断 OPD (TOPD),在可靠的截断轨迹采样上永久执行 蒸馏。数学推理实验表明,POPD 将 OPD 的训练效率提高了 3$\times$,而 TOPD 仅使用 10\% 的 rollout Horizo​​n 即可达到 OPD 性能,从而大幅减少挂钟和内存。这些结果表明,控制轨迹采样范围为更高效的 OPD 提供了一条简单实用的途径。