论文

共同发展政策 蒸馏

Co-Evolving Policy Distillation

摘要

RLVR 和 OPD 已成为 后训练 的标准范例。我们对这两种范式进行了统一分析,将多个专家能力整合到一个模型中,以不同的方式识别能力损失:混合 RLVR 会遭受能力间发散成本的影响,而先训练专家然后进行 OPD 的流程虽然避免了发散,但由于教师和学生之间存在较大的行为模式差距,无法完全吸收教师的能力。我们提出共同进化政策蒸馏(CoPD),鼓励专家并行训练,并在每个专家正在进行的RLVR训练期间而不是在完成专家训练之后引入OPD,由专家充当共同老师(使OPD双向)来共同进化。这使得专家之间的行为模式更加一致,同时始终保持足够的互补知识。实验验证,CoPD 实现了文本、图像和视频推理能力的一体化集成,显着优于混合 RLVR 和 MOPD 等强基线,甚至超越了特定领域的专家。 CoPD 提供的模型并行训练模式可能会激发一种新颖的训练扩展范式。