论文
时间扩展的专家混合模型
Temporally Extended Mixture-of-Experts Models
摘要
专家混合模型现在流行用于以固定推理速度扩展容量,几乎可以在每个词元上切换专家。一旦模型超出了可用的 GPU 内存,这种流失就会导致卸载和预取等优化变得无效。我们证明强化学习中的选项框架是解决这个问题的完美匹配,并主张临时扩展的专家混合层。基于具有审议成本的选项批评框架,我们向每一层添加一个控制器,用于学习何时切换专家集以及加载哪些专家集。通过将其应用于具有低秩适配器和自我 蒸馏 奖励的 gpt-oss-20b,我们的方法将切换率从超过 50% 降低到 5% 以下,同时在 MATH、MMLU 和 MMMLU 上保留高达 90% 的基本模型精度。这表明,即使现有的预训练模型也可以通过轻量级训练转换为临时扩展的 MoE,而深思熟虑的成本允许模型训练者在转换率与能力之间进行权衡。我们希望这为不断增长的 MoE 模型中的内存高效服务和持续学习开辟了一条以选项框架为基础的原则性道路。