论文

Open-MOPD:诊断和修复多教师能力不平衡 同策略 蒸馏

Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation

摘要

多教师 同策略 蒸馏 (M-OPD) 已成为一种有前途的范例,通过密集的 词元级 奖励监督将领域专业强化学习 (RL) 专家整合为单个通才学生。尽管在实践中取得了成功,但控制多教师能力集成的优化动态仍然知之甚少,并且明显缺乏开放的、严格可重复的方法。在这项工作中,我们利用预言机路由在 SmolLM3-3B-Base 上建立了受控的 M-OPD 基准,将功能集成与路由模糊性隔离开来。我们的调查揭示了明显的能力集成差距:相对于域路由的预言机集成,标准 M-OPD 仅捕获了 35.6% 的可用空间,并且任务简明,例如在遭受严重退化和过早停滞后的指令。至关重要的是,我们表明这种失败并非源于梯度冲突,而是源于 词元级 优化预算的严重错误分配。这种病态是由三个正交因素驱动的:跨域的结构序列长度差异、由于学习率不均匀导致的动态收敛漂移以及异步策略更新导致的多步奖励陈旧性。为了解决这些不平衡问题,我们引入了 Open-MOPD,这是一个结合了词元份额平衡、差距感知动态预算分配和学生奖励刷新的原则框架。这些机制共同系统地恢复了跨域平衡,将单个可部署学生的余量恢复从 35.6% 提高到 83.4%。我们在学术上可访问的硬件预算上完全开源我们的端到端 后训练 配方、训练轨迹和评估套件。