论文
CERA-MoA:让路由机制与持续学习的智能体协同演化
CERA-MoA: Co-Evolving Routing Mechanisms with Continually Learning LLM Agents
摘要
当前混合智能体MoA范式通常将查询路由和智能体微调分开处理,限制了对智能体能力演变的响应。这种脱节既使路由策略无法适应后训练中的能力变化,也妨碍智能体形成协同的数据驱动专业分工。为此,我们提出CERA-MoA,即路由器与持续学习智能体协同演化的混合智能体框架。在这一迭代强化学习框架中,动态路由器和独立智能体策略共同演化。我们设计预测性熟悉度估计器,利用中间层隐藏状态评估智能体的语义胜任度,避免完整轨迹展开的开销。根据熟悉度分数,累计阈值自适应路由机制动态激活定制的最小智能体子集,在任务表现与效率间取得权衡。CERA-MoA还依据持续变化的胜任度主动分配针对性训练样本,促进能力差异化。跨多个领域的大量实验显示,它优于先进的静态智能体路由和固定工作流微调基线。
