论文
从学生状态下的教师续写中学习
Learning from Teacher Continuations at Student States
摘要
我们推出 OLIVE(在线干预)。在每次迭代中,不断发展的学生策略都会生成一个新的前缀,教师继续自回归,并使用根据教师生成的标记计算的交叉熵来更新学生。每个设计选择都针对现有蒸馏方法的相应限制:(1)固定教师轨迹上离线监督微调(SFT)中的顺序协变量移位,(2)词元级on-policy蒸馏(OPD)中前缀失败下的碎片监督,以及(3)在分布匹配蒸馏中需要访问教师词元概率。 OLIVE 在相当的 GPU 小时成本下实现了比 OPD(具有 top-16 KL 近似值)更高的推理性能。我们的异步实现进一步将 OLIVE 的总训练时间减少了 23.8%。我们在硬推理任务和反映现代训练后场景的 Agentic 任务上评估 OLIVE,并且在相同的训练预算下它始终优于现有的蒸馏方法。通过从不断发展的学生中重新生成前缀,OLIVE 在离线蒸馏平台后继续改进,同时更好地保留学生的一般能力和可塑性。仅使用 GPT-5.4-mini 中的文本,使用 OLIVE 进行连续训练,在 ScienceWorld 上的性能比同一位老师的离线 SFT 提高了 13%。这些结果支持 OLIVE 作为一种有效且高效的在线语言模型蒸馏方法。