论文

MOPD:多教师 同策略 蒸馏,用于 LLM 后训练 中的能力集成

MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training

摘要

现代 大语言模型 (LLM) 依靠 后训练 期间的强化学习来推动特定功能,但将多种功能集成到一个模型中仍然很困难。现有的方法,例如 离策略 Finetune 和 Mix-RL,要么效率低下,要么性能下降。在这项工作中,我们提出了多教师 同策略 蒸馏 (MOPD),这是一种结合多个领域 RL 教师能力的 后训练 范式:我们首先运行每个域的专门 RL 来获取一组领域教师,然后将这些教师在学生自身执行轨迹中提取出来。这消除了曝光偏差并提供了密集的优化信号。在 Qwen3-30B-A3B 上,MOPD 优于 Mix-RL、Cascade RL、离策略 Finetune 和 Param-Merge 基线,继承了几乎所有教师的能力。 MOPD 还支持领域教师并行、独立开发,消除了多域 后训练 典型的跨域耦合。 MOPD已部署在工业级前沿模型MiMo-V2-Flash的后训练中,展示了其在前沿级LLM能力集成方面的实用价值。