论文
轻量级 微调 下的路由器灵敏度识别混合专家模型中的可修剪专家
Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models
摘要
专家混合 (MoE) 模型将参数计数与每个词元的计算解耦,但部署仍然需要在内存中托管每个专家。最近的理论表明,在 微调 期间路由器权重变化最小的专家可以通过可证明的精度保留进行修剪,但保证假设完全 微调。我们证明可以通过简短的参数有效适应来引出信号。我们使用轻量级适配器进行微调,根据引起的路由器变化对专家进行排名,并一次性删除变化最少的专家。在 Mixtral-8$\times$7B-Instruct 上,仅使用路由器的 LoRA 训练了 0.002% 的参数,并在删除了一半专家的情况下保留了 27.54% 的 MMLU-Pro 准确率,而幅度和随机修剪的准确率约为 16%。信号质量随适配器大小单调提高,达到 28.76%,并随着适应范围扩展到路由器之外而下降。在他们的共享预算下,IA3 达到 28.04%,而霍尔斯比则达到 25.39%。该标准转移到针对数学推理进行微调的 Qwen1.5-MoE,在删除了一半专家的情况下,在 11 个基准测试中保留了 49.7% 的平均准确度。结构修剪将内存减少了 49%,每个词元的延迟减少了 37%。因此,轻量级路由器灵敏度使得可证明动机的、任务条件化的专家修剪在规模上变得实用。