论文
ReMoE:在内存受限的 MoE LLM 推理中通过路由器 微调 提高专家重用
ReMoE: Boosting Expert Reuse through Router Fine-Tuning in Memory-Constrained MoE LLM Inference
摘要
细粒度专家混合 (MoE) 模型仅稀疏地激活每个词元的专家子集,从而减少激活的计算,同时保持高模型容量。然而,在内存受限的推理场景中,只能缓存一小部分专家。不在缓存中的专家必须从慢速外部存储(例如 UFS)中获取,从而导致频繁的驱逐和大量的 I/O 开销。我们提出 ReMoE,一个路由器 微调 框架,旨在促进词元明智的专家重用。 ReMoE 将路由器偏向于最近选择的专家,从而生成更好地匹配缓存局部性约束的暂时稳定的路由。通过增加短期专家重用,ReMoE 减少了专家从存储中的获取,而无需增加推理时间计算。 DeepSeek 和 Qwen 模型上的实验表明,ReMoE 在保持下游任务性能的同时将专家重用率提高了 26%。实际系统评估进一步证实了这些优势,在 vLLM GPU-CPU 专家卸载下,输出吞吐量提高了 8.4%,在 Jetson Orin NX 上的 llama.cpp 下,TPOT 降低了 43.6-49.8%,相当于在不同工作负载下解码速度提高了 1.77-1.99$\times$。检查点和使用说明可在 https://github.com/BUAA-OSCAR/ReMoE 上找到。