论文
MoECa:将特征重用与扩散中的专家分解结合起来 Transformer
MoECa: Aligning Feature Reuse with Expert Decomposition in Diffusion Transformers
摘要
具有混合专家 (DiT-MoE) 的扩散 Transformer 提高了稀疏激活下的模型容量,但扩散推理仍然受到跨时间步的冗余计算的瓶颈。现有的缓存方法主要在 词元级 上运行,这在 DiT-MoE 中变得次优,因为每个词元更新在内部分解为多个路由专家分支。我们的分析表明,DiT-MoE 中的跨时间步冗余在专家分支级别上比在整个 词元级 级别上得到了更好的表征。基于这一观察,我们提出了 MoECa,一种细粒度的缓存框架,可以跨时间步执行分支级特征重用。 MoECa 进一步引入了专家感知自适应控制以及跨 MoE 和注意力路径的同步缓存更新,以维持稳定的中间状态。对多个 DiT-MoE 模型的实验显示出有利的速度与质量权衡,在保持生成质量的同时,速度提升高达 2.93$\times$。