论文
D³-MOPD 按领域收敛动态调节多教师蒸馏数据
D$^3$-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation
摘要
多教师同策略蒸馏(MOPD)沿学生自身生成轨迹,最小化各领域的反向KL散度,将多个领域专家教师的能力蒸馏到单个学生。现有方法通常在训练前固定领域数据配比,忽略不同领域收敛速度可能差异很大:部分领域早早进入平台期,其他领域仍持续改善。因此,固定配比会在快收敛领域浪费算力,使慢收敛领域训练不足。我们提出D³-MOPD,复用训练中已有的各领域反向KL信号,在线调节数据配比,无需额外训练计算。一个在训练进程之外异步运行的监测器,定期跟踪各领域KL轨迹,估计剩余提升空间及当前改善速度,据此调整采样比例,不改变核心训练循环。该方法自然支持任意数量领域;领域越多、收敛模式越多样,调度器预期可利用的收益越大。以Qwen3.6-35B-A3B为学生、四个领域专家为教师,D³-MOPD弥合了学生与教师平均性能差距的97%,普通MOPD为63%;达到相同峰值表现所需轨迹生成步数约降至三分之一,且在七个基准中的三个上超过专家教师。