论文

Train4Merge:针对基于 OPD 的模型合并的 RL 与 SFT 教师的受控单教师研究

Train4Merge: A Controlled Single-Teacher Study of RL vs. SFT Teachers for OPD-Based Model Merging

摘要

从共享检查点训练的领域专家可以通过策略蒸馏(OPD)合并到一个模型中,他们充当老师,监督学生按照自己的轨迹进行学习。很少有人研究上游的一个选择:是否使用监督微调(SFT)或强化学习(RL)来构建每个专家。然而,同样强大的教师不一定是同样优秀的教师。我们通过受控的单教师 OPD(多教师 OPD 的构建块)来探讨这一选择:在 Agentic、推理和感知中,性能相当的 SFT 和 RL 教师从 Qwen3.5-9B 开始接受培训,每个教师都指导一个从中初始化的学生。在最佳检查点,RL 指导的学生在 Agentic、推理和感知方面的表现分别比 SFT 指导的学生高出 4.27、1.50 和 0.86 个百分点,并且比基本模型恢复了更多教师的表现增益。这种对比在 Agentic 中最为明显,其中最好的 SFT 指导学生仅恢复了其老师增益的 44.44%,而最好的 RL 指导学生恢复了 115.00%,超过了其老师。我们的分析给出了一个解释:强化学习教师比 SFT 教师更接近参数空间中的共享初始化,因此学生更容易理解。