论文
面向 Agentic 强化学习的相位感知专家混合
Phase-Aware Mixture of Experts for Agentic Reinforcement Learning
摘要
强化学习(RL)赋予 LLM 智能体解决复杂任务的强大能力。但现有 RL 方法通常使用单一策略网络,导致简单性偏置:简单任务占据多数参数并主导梯度更新,复杂任务容量不足。一个可行的补救是在策略网络中采用专家混合(MoE)架构,MoE 让不同参数(专家)专注不同任务,防止简单任务主导所有参数。然而传统 MoE 的关键局限是词元级路由:路由器把每个词元分派给专门专家,把相位一致的模式割裂成分散的专家指派,从而削弱专家专业化。本文提出相位感知专家混合(PA-MoE)。它首先配备轻量的相位路由器,直接从 RL 目标学习潜在相位边界,无需预定义相位类别。然后,相位路由器把时间上一致的指派分配给同一专家,使专家得以保持相位特有专长。实验结果证明了所提 PA-MoE 的有效性。
