论文
CLOOPD:同策略蒸馏中关闭学习者循环
CLOOPD: Closing the Learner Loop in On-Policy Distillation
摘要
同策略蒸馏 (OPD) 为每个新批次支付两次费用:学生生成轨迹,更强的老师对其进行评分。现有的方法改进了对哪些轨迹进行评分以及如何构建教师信号,但通常会通过一次演员更新来消耗它。我们引入了 CLOOPD,一个将教师信号获取与学生端实现分离的闭环框架。 CLOOPD 在 KL 信封内选择一个自适应 $\alpha$ 路径点,冻结评分批次及其优点,在每个参与者通过后重新转发学生,测量实现,并在单独的词元预算下分配参与者工作。该框架包括确定性的两遍和三遍策略、词元定价的 CLOOPD-TPMR 以及预算匹配的控制。在 8-H20 节点上的 6 次 300 步运行中,每个 CLOOPD 策略都在可比的教师词元规模下改进了一次性 TOP-D 锚:CLOOPD-Fixed2 的宏观准确率从 15.41 上升到 17.78,CLOOPD-Fixed3 的宏观准确率从 19.36 上升。在第 100 步,CLOOPD-Fixed3 达到 15.35,几乎与第 300 步的 TOP-D 相当,同时使用的教师评分词元减少了 67.2%,GPU 小时数减少了 28.0%。早期的 8-A100 消融表明自适应 $\alpha$ 消除了观察到的信任信封违规;第三遍增加了净空。这些结果将 CLOOPD 定位为一个框架,用于预算学生如何充分地从教师评分的词元中学习。