论文
多智能体系统的动态专家剪枝
Dynamic Expert Pruning for Multi-Agent Systems
摘要
MoE架构通过每token只激活少数专家高效扩展语言模型,但节省仅限计算:每个专家都必须驻留在加速器上,内存限定了这些模型可部署的位置。专家剪枝缩小这一足迹,但既有方法是静态的——一份离线校准的掩码对所有后续请求使用。当负载异质时该假设失效,多智能体系统最明显:一个骨干同时服务多任务多角色。我们的分析显示不同任务与角色征用不同专家,而静态方法把固定子集分配给所有角色。为此我们提出动态专家剪枝(DEP),基于我们确立的发现:智能体的系统与任务提示本身就足以识别该智能体及其任务所需的专家——文本已描述智能体将做什么。在工作流转写上一次性训练的轻量预测器把这些提示经单次前向转为专用的每请求掩码,无需逐配置校准。跨多样任务与角色、模型规模与MoE架构,DEP的总体准确率优于静态剪枝与合并基线,并在不重训的情况下泛化到训练未见的工作流;相对基线的优势在保留专家很少时最大,提示多智能体系统固有的角色专业化允许比静态剪枝更稀疏的服务。