论文
RouteMoA:无需预推理的动态路由助推高效Mixture-of-Agents
RouteMoA: Dynamic Routing without Pre-Inference Boosts Efficient Mixture-of-Agents
摘要
Mixture-of-Agents(MoA)通过分层协作提升LLM性能,但其密集拓扑推高了成本和延迟。现有方法使用LLM裁判过滤响应,但仍需所有模型先完成推理再评判,无法有效削减成本。它们也缺乏模型选择标准,且难以应对大型模型池,因为全量推理成本高昂且可能超出上下文限制。为此,我们提出RouteMoA,一个具有动态路由的高效混合智能体框架。它采用轻量打分器,通过从查询预测粗粒度性能进行初筛,在无需推理的情况下将候选缩小为高潜力子集。随后,一组裁判基于现有模型输出,通过轻量的自评与互评精化这些分数,在无需额外推理的情况下提供后验校正。最后,模型排序机制通过平衡性能、成本和延迟来选择模型。RouteMoA在不同任务和模型池规模下均优于MoA,在大规模模型池中将成本降低89.8%、延迟降低63.6%。
