论文

EFlow:通过高效的解决方案流程从头开始进行快速的几步视频生成器训练

EFlow: Fast Few-Step Video Generator Training from Scratch via Efficient Solution Flow

模型训练预训练

摘要

缩放视频扩散 Transformer 从根本上受到两个复合成本的瓶颈:每步注意力的昂贵的二次复杂度和迭代采样步骤。在这项工作中,我们提出了 EFlow,一种高效的几步训练框架,可以同时解决这些瓶颈。为了减少采样步骤,我们建立了一个解决方案流目标,该目标学习将时间 t 的噪声状态映射到时间 s 的函数。然而,要使该公式在视频规模上在计算上可行且高质量,需要两项互补的创新。首先,我们提出了门控局部全局注意力(Gated Local-Global Attention),这是一种可丢弃词元的混合块,它高效、富有表现力,并且在激进的随机词元丢弃下保持高度稳定,从而大大减少了每步计算。其次,我们开发了一种有效的几步训练方法。我们提出 Path-Drop Guided 训练,用计​​算成本低的弱路径取代昂贵的引导目标。此外,我们还使用平均速度加性正则化器来增强这一点,以确保在极低的步数下实现高保真度。总之,我们的 EFlow 实现了实用的从头开始训练管道,训练吞吐量比标准解决方案流高出 2.5 倍,推理延迟比标准迭代模型低 45.3 倍,在动力学和大规模文本到视频数据集上具有具有竞争力的性能。