论文
打破均匀性陷阱:通过 SplitMoE 缩放视频扩散模型
Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE
摘要
专家混合(MoE)因大语言模型而流行,是扩展视觉生成模型的有前途的范例。然而,传统的基于词元的 MoE 在同质专家池中独立路由词元,并规范专家使用以实现一致性,从而使其与时空冗余和语义长尾的视频数据匹配不佳。我们表明,现有的视觉 MoE 陷入了一致性陷阱:语义上组织不足的路由,再加上统一的专家使用正则化,将连贯的补丁分散在不同的专家之间,导致路由碎片和结构扭曲。为了解决这个问题,我们提出了 SplitMoE,一种打破一致性束缚的角色分离稀疏架构。为了适应固有的语义不平衡,我们明确地将专家库分为语义专家和通用专家,语义专家捕获高级语义抽象,通用专家保留剩余视觉信息和灵活的生成能力。利用原型引导的路由和拉推正则化,SplitMoE 使词元能够通过语义属性而不是任意平衡约束自然地集群。大量结果表明,在同等激活参数预算下,SplitMoE 在标准基准测试中的收敛速度、路由一致性和视频生成质量方面优于传统的负载平衡 MoE。通过揭示一种新兴的从粗到精的去噪逻辑,SplitMoE 为社区提供了一种模态感知的缩放路径,作为构建大规模视频世界模型的关键参考。