论文
dMoE:具有可学习区块专家的 dLLM
dMoE: dLLMs with Learnable Block Experts
摘要
Diffusion 大语言模型 (dLLM) 最近已成为自回归模型的有前景的替代方案,提供有竞争力的性能,同时自然支持并行解码。然而,随着 dLLM 越来越多地与专家混合 (MoE) 架构集成以扩展模型容量,块并行解码和 词元级 专家选择之间出现了根本性的不匹配。具体来说,每个 dLLM 前向传递处理具有双向依赖性的多个词元,而传统的 MoE 层独立路由每个词元。这种不匹配大大增加了唯一激活的专家的数量,使推理越来越受内存限制。为了解决这个问题,我们提出了 dMoE,一个简单而有效的块级 MoE 框架。 dMoE 的中心思想是将每个块内的 词元级 专家分布聚合为统一的块级专家分布,然后用于以更连贯的方式指导专家路由。通过这种方式,dMoE 在不牺牲性能的情况下大幅减少了推理过程中唯一激活的专家数量,从而缓解了内存限制瓶颈。跨各种基准的大量实验证明了 dMoE 的有效性。平均而言,dMoE 将唯一激活的专家数量从 69.5 个减少到 14.6 个,同时保留了 99.11% 的原始性能。同时,它将内存使用量减少了 76.64% 至 79.84%,并实现了 1.14$\times$ 至 1.66$\times$ 端到端延迟加速。代码位于:https://github.com/fscdc/dMoE