论文
MEPA:专家混合的视觉自回归建模的多尺度表示对齐
MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts
摘要
视觉自回归建模(VAR)开创了从粗到细的多尺度自回归生成范式,展示了强大的图像生成能力。然而,VAR 在多尺度表示学习方面仍然存在固有的缺陷。具体来说,较低的尺度主要捕获全局语义,而较高的尺度则侧重于细粒度的细节。跨规模采用共享架构会引发优化冲突。此外,由于因果自回归过程,早期尺度上不准确的语义可能会传播并显着降低最终输出的质量。为了解决这些问题,我们引入了一种规模感知的词元路由专家混合(MoE)架构,允许规模自适应专家选择,从而促进跨规模的解耦表示学习。此外,我们通过结合外部自我监督特征来增强早期规模的语义建模。与朴素对齐不同,我们分析并设计了适合 VAR 范式的剩余特征聚合方案。大量的实验表明,我们的方法显着提高了训练效率和生成质量。在 ImageNet 256*256 基准上,与密集基线相比,我们的模型实现了卓越的 FID,同时仅需要默认训练周期的一半和更小的参数预算,训练成本仅略有增加。此外,随着训练周期的增加,性能差距进一步扩大。