论文

ViRDM:驯服表示分布匹配以实现少步因果视频生成

ViRDM: Taming Representation Distribution Matching for Few-Step Causal Video Generation

模型训练参数高效训练

摘要

少步自回归(AR)视频扩散可以实现低延迟流生成,但现有的训练后方法主要依赖于分布匹配蒸馏(DMD),需要大量经过预训练的教师和在线评论家通过扩散分数来估计分布差异。在这项工作中,我们询问是否可以通过仅针对预先计算的目标分布对生成器进行后训练来消除这种资源密集型教师-评论家堆栈。受到一步图像生成的表示分布匹配(RDM)的启发,我们系统地研究了其向几步因果视频生成的迁移,并确定了三个关键障碍:内存难以处理的梯度路径、独特的视频优化机制以及限制时间动态的表示分布。我们引入了 ViRDM,这是一种无需教师和评论家的视频后训练配方,可以按顺序解决这些障碍。通过将 RDM 与随机截断的干净退出监督、轻量级 VAE 解码器和阶段向量(Jacobian 产品)相结合,ViRDM 使表示分布匹配内存对于多步骤因果视频生成轨迹变得可行。我们进一步为视频 RDM 建立有效的生成群体和初始化机制,并引入轻量级动态正则化来补偿约束不足的时间动态。 ViRDM 将三网络蒸馏转变为仅生成器的后训练,减少 GPU 内存使用和训练时间,同时提高视频质量。只需 20 次生成器更新,该配方在官方 VBench 评估中就达到 84.87,比之前最好的几步因果基线高出 0.36,同时需要 16 个 A100 GPU 小时。我们还报告了探索性结果,证明了相同方法在降低因果抽样预算以及一步、两步和四步双向生成方面的潜力。