论文
路由、通信与推理:面向高效多智能体推理的门控路由与自适应深度
Route, Communicate, and Reason: Gated Routing and Adaptive Depth for Efficient Multi-Agent Reasoning
摘要
多智能体集成成倍增加活跃参数与推理成本,却未回答三个基本问题:咨询哪些智能体、一个查询应在智能体层级中穿行多深、智能体间通信何时值得其成本。我们提出GRADE(面向高效推理的门控路由与自适应深度):一个层级多智能体系统,四个轻量学习门共同治理智能体选择、层级深度、智能体间通信与分支剪枝。训练采用CoGRPO(协作群相对策略优化)——一种把GRPO适配到多智能体层级、为参与rollout的每个门与智能体分配共享优势信号的新型无需价值评估器配方。智能体模型取自热插拔的专家注册表;逐智能体校准映射允许在推理时替换专家而无需重训。在约170亿平均活跃参数下:GRADE在GSM8K、MMLUPro与GPQA上超过所有基线——以一半活跃算力在MMLUPro上超最强基线4.8分;在模型深度占主导的AIME-2025上仍与既有框架有竞争力。消融隔离出层级与掩码交叉注意力是准确率的最大贡献者,并显示逐智能体校准对安全热插拔必不可少。
