论文

Lightning OPD 2.0:减轻大型推理模型的跨教师 同策略 蒸馏 中的风格偏差

Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models

摘要

同策略 蒸馏 (OPD) 提供来自教师的密集 词元级 监督,但其有效性可能取决于教师的一致性,这意味着提供 OPD 监督的模型还应该生成用于训练监督 微调 (SFT) 参考的演示。然而,当 SFT 数据具有混合或未知来源时,或者当 SFT 数据生成和后续 蒸馏 首选不同模型时,在实践中经常违反此条件。在这种跨教师的环境中,即使是更强大的 OPD 教师也无法比 SFT 参考取得什么进步。我们发现,原始的教师参考分歧包含潜在有用的特定情境教师证据,以及与措辞、格式和推理节奏差异相关的重复成分。我们引入了具有交叉拟合风格残差的 Lightning OPD 2.0,它使用轨迹级交叉拟合来估计此重复组件,作为风格词元偏差的操作代理,并在构建 词元级 OPD 更新之前将其减去。在数学推理和代码生成基准测试中,Lightning OPD 2.0 在跨教师设置中始终优于 Lightning OPD。从 Klear-Reasoner-8B-SFT 开始,Lightning OPD 2.0 在 AIME 2024 上达到 82.4%,在 LiveCodeBench v5 上达到 63.0%。总之,这些结果将 Lightning OPD 2.0 确立为跨教师 OPD 的实用方法,放宽教师一致性作为先决条件,并允许独立选择 SFT 数据生成器和 蒸馏 教师。代码即将发布。