论文

REVO:通过方差引导重用实现高效的离策略蒸馏

REVO: Rollout-Efficient Off-Policy Distillation via Variance-Guided Reuse

摘要

on-policy蒸馏 (OPD) 使用密集的标记级教师监督对学生生成的轨迹来训练语言模型。然而,它对频繁刷新的学生部署的依赖往往会产生大量的生成成本。我们引入了 REVO,这是一个off-policy蒸馏框架,它通过重用每个学生的rollout来进行多步学习者更新来提高rollout效率。 REVO 通过稳定的前缀权重和当前学生的一步重采样来解决前缀级别和当前词元策略不匹配的问题,从而无需重新生成完整轨迹即可重复更新。为了在重用的部署中优先考虑信息词元位置,REVO 使用学生-教师对数概率比的方差来量化剩余的词元级别学习信号并指导重复优化。在多个学生-教师规模中,仅 50 次rollout迭代的 REVO 就匹配或超过了在域内和跨域推理基准上经过 200 次迭代训练的 OPD 基线。