论文

MoE-GRPO:通过视觉语言模型中的强化学习优化专家组合

MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models

模型训练强化学习

摘要

专家混合 (MoE) 已成为一种有效的方法,通过稀疏地激活每个词元的参数子集,同时保留高模型容量来减少 Transformer 架构的计算开销。这种范例最近已扩展到视觉语言模型(VLM),从而实现可扩展的多模式理解并降低计算成本。然而,广泛采用的确定性top-K路由机制可能会忽略更优化的专家组合并导致专家过度拟合。为了解决这一限制并提高专家选择的多样性,我们提出了 MoE-GRPO,这是一种基于强化学习(RL)的框架,用于优化基于 MoE 的 VLM 中的专家路由。具体来说,我们将专家选择制定为顺序决策问题,并使用组相对策略优化(GRPO)对其进行优化,使模型能够通过探索和基于奖励的反馈来学习自适应专家路由策略。此外,我们引入了一种模态感知路由器指导,通过阻止路由器探索针对给定模态很少激活的专家来提高训练稳定性和效率。对多模态图像和视频基准的大量实验表明,MoE-GRPO 通过促进更多样化的专家选择,始终优于标准的 top-K 路由及其变体,从而减轻专家过度拟合并实现任务级专家专业化。