论文

为 Agentic 强化学习组织 MoE 专家选择

Structuring MoE Expert Selection for Agentic Reinforcement Learning

模型训练强化学习

摘要

长视野 LLM 智能体经常使用稀疏混合专家 (MoE) 模型来实现,但 Agentic 行为和 MoE 结构的协同设计仍未得到充分探索。在这项工作中,我们全面研究了 Agentic 后训练与教育部专家选拔之间的联系。在现成的 MoE 模型中,我们观察到专家选择表现出一种与 Agentic 轨迹自然对齐的特殊结构。具体来说,专家路由在智能体执行语义相似操作(例如,读取、更新)的轮次之间比具有不同操作的轮次之间重叠更多。然而,标准 RL 算法忽略了这种专门化,使得 MoE 路由在训练期间不受控制,这从经验上限制了任务性能和推理效率。为了解决这个问题,我们为 Agentic 任务引入了分层路由控制框架。我们明确鼓励回合级专家选择与 Agentic 操作保持一致,同时规范 token 级专家选择以保持本地一致性。为了使用所提出的方法解决 后训练期间出现的稳定性问题,我们进一步引入了熵门控制机制。总体而言,我们的路由控制框架在所有评估基准上的成功率均提高了 10 点以上。这些结果表明,Agentic 轨迹结构为优化 RL 后训练期间的 MoE 容量提供了有效的信号。

为 Agentic 强化学习组织 MoE 专家选择:论文原图
图 1:Agentic 轨迹的 MoE 路由控制概述。上:在与环境的每一次交互中,智能体都会产生思维和工具使用场,然后接收环境反馈。我们的路由控制框架旨在使每轮的专家选择与 Agentic 操作(例如,读取、创建和更新)保持一致,为不同的操作分配不同的专家组,并鼓励每轮中相似的专家选择。底部:借助 AppWorld 上的 Qwen3-30B-A3B,我们的路由控制框架(与标准 RL 一起使用时)通过提高专家专业化(附录 A.1 中专家使用相似性的交叉差距更大)和一致性(更高的 Jaccard 分数)来解锁性能限制并提高推理吞吐量。