论文
ELT:用于视觉生成的弹性环 Transformer
ELT: Elastic Looped Transformers for Visual Generation
摘要
我们引入了 Elastic Looped Transformer (ELT),这是一种基于循环 Transformer 架构的高度参数高效的视觉生成模型。虽然传统的生成模型依赖于独特的 Transformer 层的深堆栈,但我们的方法采用迭代、权重共享的 Transformer 块来大幅减少参数数量,同时保持较高的合成质量。为了有效地训练这些模型以生成图像和视频,我们提出了 Intra-Loop Self 蒸馏 (ILSD) 的想法,其中学生配置(中间循环)是从教师配置(最大训练循环)中提取出来的,以确保单个训练步骤中模型深度的一致性。我们的框架通过一次训练运行生成一系列弹性模型,从而实现随时推理能力,并在计算成本和生成质量之间进行动态权衡,并具有相同的参数数量。 ELT 显着改变了视觉合成的效率前沿。在 iso-inference-compute 设置下,参数数量减少了 4\times$,ELT 在类条件 ImageNet 上实现了具有竞争力的 FID $2.0$,在类条件 ImageNet $256 \times 256$ 上实现了具有竞争力的 FID,在类条件 UCF-101 上实现了 $72.8$ 的 FVD。