论文

Lightning OPD:用于离线大型推理模型的高效 后训练 同策略 蒸馏

Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation

摘要

同策略 蒸馏 (OPD) 是 大语言模型 的有效 后训练 范例,但在整个训练过程中需要实时教师服务器,从而导致大量基础设施开销。我们研究 OPD 是否可以通过在 SFT采样轨迹期间预先计算教师对数概率并在训练期间重用它们来离线执行。我们发现,天真地这样做无法可靠地匹配标准 OPD,并将根本原因追溯到之前被忽视的条件,我们称之为教师一致性,要求同一教师用于受监督的 微调 和 OPD。违反此条件会引入梯度偏差,从而降低离线和在线 OPD 的性能。基于这一见解,我们提出了 Lightning OPD,这是一个离线 同策略 蒸馏 框架,可以强制教师一致性并完全消除对实时教师服务器的需求。我们证明,在教师一致性下,闪电 OPD 与标准 OPD 具有相同的最优值,具有有限的梯度差异和有助于防止策略漂移的隐式正则化效应。数学推理和代码生成实验表明,Lightning OPD 的性能与标准 OPD 相当,同时训练效率提高了 4.0 倍。从 SFT 初始化的 Qwen3-8B-Base 模型开始,Lightning OPD 在 AIME 2024 上仅用了 30 个 GPU 小时就达到了 69.9%。 Lightning OPD 进一步扩展到 MoE 架构,在单个 8xH100 节点上将 Qwen3-30B-A3B 在 AIME 2024 上训练到 71.0%,大大降低了 LLM 后训练 的学术研究障碍。我们的代码发布于 https://github.com/jet-ai-projects/Lightning-OPD。