论文

Chimera:设计和龙猫缩放混合视觉扩散 Transformer

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

模型架构混合架构

摘要

视觉生成越来越需要高分辨率图像、长视频和多模态上下文,这使得充分注意力的二次成本令人望而却步。我们引入了 Chimera,一种具有原则性缩放配方的混合视觉扩散主干。 Chimera 在一个光栅排序流中处理文本、图像和视频标记,无需位置嵌入。它结合了用于长上下文状态跟踪的 Kimi Delta Attention (KDA) 和 O(N) 复杂度、用于直接全局交互的交错多头潜在注意力 (MLA) 以及用于局部时空上下文的模态感知短卷积。稀疏专家混合 (MoE) 层可扩展容量,同时控制激活的计算。为了扩展这种异构架构,我们引入了 HeteroP,这是一种模块级方案,可根据每个张量的功能扇入和模型深度在宽度和深度上传输超参数。 HeteroP 产生了一个一致调整的系列,用于适应激活模型大小、训练词元计数和图像视频数据比率的 Chinchilla 式计算最优法则。在这些定律的指导下,我们训练了具有 2B 个激活参数的 11B 参数 Chimera。实验显示了三个结果。首先,通过预训练扩散损失进行测量,密集主干网的计算效率是匹配的全注意力 Wan-2.1 2B 基线的 1.7 倍,而整个系统达到 7.3 倍。其次,在没有特定长度的 微调 的情况下,Chimera 将零镜头从 5 秒训练剪辑推断为 30 秒视频,最后 5 秒 FID 仅下降 6.5%。第三,拟合定律表明,计算最优图像预训练在激活模型大小和训练词元计数之间几乎均匀地划分了计算量,而视频预训练在较高预算下适度支持模型大小。这些结果为设计和扩展高效的长上下文扩散架构奠定了基础。