论文

路由、通信与推理:面向高效多智能体推理的门控路由与自适应深度

Route, Communicate, and Reason: Gated Routing and Adaptive Depth for Efficient Multi-Agent Reasoning

智能体系统模型训练强化学习Agent 协作RLVRAgentic RL

摘要

多智能体集成成倍增加活跃参数与推理成本,却未回答三个基本问题:咨询哪些智能体、一个查询应在智能体层级中穿行多深、智能体间通信何时值得其成本。我们提出GRADE(面向高效推理的门控路由与自适应深度):一个层级多智能体系统,四个轻量学习门共同治理智能体选择、层级深度、智能体间通信与分支剪枝。训练采用CoGRPO(协作群相对策略优化)——一种把GRPO适配到多智能体层级、为参与rollout的每个门与智能体分配共享优势信号的新型无需价值评估器配方。智能体模型取自热插拔的专家注册表;逐智能体校准映射允许在推理时替换专家而无需重训。在约170亿平均活跃参数下:GRADE在GSM8K、MMLUPro与GPQA上超过所有基线——以一半活跃算力在MMLUPro上超最强基线4.8分;在模型深度占主导的AIME-2025上仍与既有框架有竞争力。消融隔离出层级与掩码交叉注意力是准确率的最大贡献者,并显示逐智能体校准对安全热插拔必不可少。

路由、通信与推理:面向高效多智能体推理的门控路由与自适应深度:论文配图
图 1:GRADE 概述。编码的查询传递到轻量级编排器,其深度门设置推理深度。编排器将查询路由到管理器模块,管理器模块的每个子池分组信号会偏向分配门,该分配门仅激活专家注册表中最相关的专家子代理。专家通过交叉阅读门有选择地交换消息,然后他们的输出通过屏蔽交叉注意力进行融合,并通过修剪门,在聚合之前删除低效用分支。轻量级适配器和每个代理校准图允许更换专家而无需重新培训。 CoGRPO 通过对协调部署进行采样、计算共享的组相对优势以及使用单个策略梯度步骤更新所有参与的门和代理来联合优化路由、深度、通信、修剪和聚合。