论文
Dense2MoE:通过统一修剪和升级推动设备上 LLM 的帕累托前沿
Dense2MoE: Pushing the Pareto Frontier of On-Device LLMs via Unified Pruning and Upcycling
摘要
专家混合 MoE 架构对于设备部署资源受限的情况很有希望,但从头开始训练这些模型会产生高昂的成本。当前的方法试图通过将密集模型升级到 MoE 来缓解这一问题,但它们经常引入参数冗余,从而降低推理效率。或者,标准层剪枝可以减轻冗余,但不可避免地会损害模型精度。为了解决这一困境,我们提出了 Dense2MoE 一种新颖的框架,通过层融合 UpCycling LF 统一剪枝和升级UC 由硬件 Roofline 理论引导 Dense2MoE 通过从冗余层中修剪带宽重关注模块,同时将其多层感知器 MLP 重新利用为 MoE 专家,系统地克服了推理内存墙。这种结构创新保留了模型的核心功能,并通过选择性词元路由严格限制活动参数。通过适度的连续 预训练 预算,Dense2MoE 有效地将公开可用的密集 LLM 转换为设备就绪的 MoE 模型大量实验表明,Dense2MoE 显着提升了设备上推理延迟与模型精度的帕累托前沿,优于最先进的密集基线压缩和标准升级方法