论文

MOSAIC:通过自适应聚合和推理并发实现高效的智能体混合调度

MOSAIC: Efficient Mixture-of-Agent Scheduling via Adaptive Aggregation and Inference Concurrency

AI 基础设施推理服务

摘要

混合代理 (MoA) 系统通过将每个查询路由到多个专家 LLM 并聚合其输出来提高推理准确性。在有限的 GPU 资源上高效执行此工作负载存在瓶颈。基于技能的路由会产生倾斜的专家需求,并且将指令调整的 LLM 与长推理模型相结合会导致生成长度的极大变化。因此,传统的调度策略会因负载不平衡而遭受显着的 GPU 空闲和吞吐量崩溃。我们推出 MOSAIC,这是一个加速 MoA 工作负载的调度框架。首先,我们制定了一个基于整数线性程序(ILP)的调度程序,该调度程序根据离线分析成本联合优化专家放置和每个工作人员的提示分配,在工作人员之间复制推理专家,同时固定轻量级专家。其次,MOSAIC 使用置信感知自适应聚合,利用专家间协议绕过重型最终聚合器 LLM 进行共识查询。在我们的 4-GPU 系统中,MOSAIC 比基线调度器实现了高达 2.5 倍的专家级、4.23 倍的聚合器级和 1.7~2.3 倍的端到端加速,同时匹配精度在 0.1pp 以内。