论文
为 Agentic 强化学习组织 MoE 专家选择
Structuring MoE Expert Selection for Agentic Reinforcement Learning
摘要
长视野 LLM 智能体经常使用稀疏混合专家 (MoE) 模型来实现,但 Agentic 行为和 MoE 结构的协同设计仍未得到充分探索。在这项工作中,我们全面研究了 Agentic 后训练与教育部专家选拔之间的联系。在现成的 MoE 模型中,我们观察到专家选择表现出一种与 Agentic 轨迹自然对齐的特殊结构。具体来说,专家路由在智能体执行语义相似操作(例如,读取、更新)的轮次之间比具有不同操作的轮次之间重叠更多。然而,标准 RL 算法忽略了这种专门化,使得 MoE 路由在训练期间不受控制,这从经验上限制了任务性能和推理效率。为了解决这个问题,我们为 Agentic 任务引入了分层路由控制框架。我们明确鼓励回合级专家选择与 Agentic 操作保持一致,同时规范 token 级专家选择以保持本地一致性。为了使用所提出的方法解决 后训练期间出现的稳定性问题,我们进一步引入了熵门控制机制。总体而言,我们的路由控制框架在所有评估基准上的成功率均提高了 10 点以上。这些结果表明,Agentic 轨迹结构为优化 RL 后训练期间的 MoE 容量提供了有效的信号。
