论文

面向 Agentic 强化学习的相位感知专家混合

Phase-Aware Mixture of Experts for Agentic Reinforcement Learning

模型架构模型训练MoE强化学习Agentic RL

摘要

强化学习(RL)赋予 LLM 智能体解决复杂任务的强大能力。但现有 RL 方法通常使用单一策略网络,导致简单性偏置:简单任务占据多数参数并主导梯度更新,复杂任务容量不足。一个可行的补救是在策略网络中采用专家混合(MoE)架构,MoE 让不同参数(专家)专注不同任务,防止简单任务主导所有参数。然而传统 MoE 的关键局限是词元级路由:路由器把每个词元分派给专门专家,把相位一致的模式割裂成分散的专家指派,从而削弱专家专业化。本文提出相位感知专家混合(PA-MoE)。它首先配备轻量的相位路由器,直接从 RL 目标学习潜在相位边界,无需预定义相位类别。然后,相位路由器把时间上一致的指派分配给同一专家,使专家得以保持相位特有专长。实验结果证明了所提 PA-MoE 的有效性。

面向 Agentic 强化学习的相位感知专家混合
图3:PA-MoE架构。上面板:相位感知路由器(Phase-Aware Router,见方法节)通过交叉注意力处理观测o_t与目标g,并通过LSTM处理动作历史h_t,以选择专家k*=argmax p_i。平衡损失ℒ_bal确保专家被均匀使用。下面板:相位感知MoE执行展示智能体与环境的交互。路由器从共享冻结基座模型(灰色)的K个基于LoRA的专家中选择专家k*。被选中的专家通过策略π_exp^{k*}(a_t|s_t,h_t,g)生成动作。训练通过RL损失ℒ_RL与多样性损失ℒ_div联合优化路由器和专家(见方法节)。