论文

世界反馈对同策略自我蒸馏的预测规律

A Predictive Law for On-Policy Self-Distillation From World Feedback

模型训练强化学习

摘要

超越简单的标量奖励,转向更丰富的世界反馈,是实现更具可扩展性的 RL 后训练 的自然途径。 同策略 self-蒸馏 (OPSD) 是一种很有前途的最新方法,它使用任意反馈作为学习信号,但与 GRPO 等现有方法相比,其可靠性仍不清楚。我们发现,学生与教师的初始表现差距与 OPSD 最终表现改善之间存在惊人一致的线性相关性。这种关系适用于上下文类型和模型系列,为预测 OPSD 配置的结果提供了强大的预测法则,而无需运行完整的训练程序。有趣的是,我们表明这种线性可预测性与模型规模一致,这表明具有更强的上下文学习能力的更大模型的新经验尺度定律的潜在基础。从本质上讲,我们的研究结果表明,OPSD 性能可以在训练之前进行预测和调整,从而提供了一种将世界反馈纳入 后训练 管道的一流组件的原则性方法。