论文

RouteMoA:无需预推理的动态路由助推高效Mixture-of-Agents

RouteMoA: Dynamic Routing without Pre-Inference Boosts Efficient Mixture-of-Agents

智能体系统Agent 协作

摘要

Mixture-of-Agents(MoA)通过分层协作提升LLM性能,但其密集拓扑推高了成本和延迟。现有方法使用LLM裁判过滤响应,但仍需所有模型先完成推理再评判,无法有效削减成本。它们也缺乏模型选择标准,且难以应对大型模型池,因为全量推理成本高昂且可能超出上下文限制。为此,我们提出RouteMoA,一个具有动态路由的高效混合智能体框架。它采用轻量打分器,通过从查询预测粗粒度性能进行初筛,在无需推理的情况下将候选缩小为高潜力子集。随后,一组裁判基于现有模型输出,通过轻量的自评与互评精化这些分数,在无需额外推理的情况下提供后验校正。最后,模型排序机制通过平衡性能、成本和延迟来选择模型。RouteMoA在不同任务和模型池规模下均优于MoA,在大规模模型池中将成本降低89.8%、延迟降低63.6%。

RouteMoA:无需预推理的动态路由助推高效Mixture-of-Agents
图3:RouteMoA 架构。该框架按层运行(左)。在每一层 l,路由器选择一个合适的 LLM 子集,其输出被聚合并传递到下一层。路由器(右)包含两个阶段:b.1 Mixture of Judges,包括一个评分器(按 a. Scorer Training 中所述训练)、自评估与交叉评估。评分器利用来自查询的先验知识预测候选模型在第 1 层的表现;后续层利用来自模型输出的后验知识,通过自评估与交叉评估细化评分。b.2 Model Ranking 通过权衡性能、成本与延迟来选择 LLM。