论文
MMOE:通过高效的专家设计实现 Diffusion Transformer 的现代化
MMOE: Modernizing Diffusion Transformers with Efficient Expert Design
摘要
现代 大语言模型 通过将容量增长与效率相结合来成功扩展,并随着容量的增长控制每个词元和部署成本。 AIGC 基础模型(AFM),特别是扩散 Transformer 主干网,已经开始采用稀疏专家,但最近的努力主要是扩大总参数数量和稀疏率,而没有导入使 LLM 扩展实用的效率机制,因此生成质量很少与训练和部署成本相平衡。这就提出了一个自然的问题:高效 LLM 扩展背后的架构原理能否以更平衡的方式适应 AFM?我们介绍了 ModernMOE (MMOE),它是 SiT 式扩散 Transformer 的现代化版本,它系统地将路由专家、共享和轻量级专家、门残差路由和注意力残差信息重用应用于 AIGC 生成。 MMOE 没有将 MoE 视为单个插件替代品,而是研究不同的现代专家组件在扩散 Transformer 内组合时如何影响收敛、效率和生成质量。本文中的每个实验均在单个 8 GPU H100 节点上进行训练,批量大小为 256,执行 400k 步骤,这是一个可承受的单机预算。在匹配的训练和采样协议下以及在此预算下,MMOE 在每个记录的检查点达到较低的 FID,也就是说,它比密集和中间稀疏专家基线在每个训练步骤收敛得更快,并且在稀疏变体中,它实现了最佳的质量成本平衡。路由分析进一步显示了跨深度的稳定专家专业化、轻量级路由的大量使用以及去噪期间适度的逐步路由变化。这些结果表明,AFM 可以通过导入经过验证的效率设计来遵循 LLM 的平衡缩放路径,而不是简单地增加总参数和稀疏比。