论文
VDOT++:非平衡最优传输蒸馏的统一少步视频生成
VDOT++: Unified Few-Step Video Generation via Unbalanced Optimal Transport Distillation
摘要
视频创作横跨文生视频(T2V)、图生视频(I2V)与条件生成,但视频扩散模型因采样中反复评估大骨干而昂贵。分布匹配蒸馏(DMD)降低该成本,但其反向KL目标在学生与教师分布重叠有限时会给出不稳定或不完整的引导。VDOT以最优传输蒸馏(OTD)应对——其显式耦合为条件生成提供几何方向。但平衡OTD对每对学生-教师帧对的空间token做全质量匹配;该假设在T2V与I2V下减弱:一个条件允许多个有效输出、空间内容无需跨不同实现对齐。我们提出VDOT++——把同一训练配方分别应用于三任务族生成器的统一蒸馏框架:经非对称非平衡形式使OTD对输出多样性鲁棒,允许不可靠学生token携带更少质量同时保持对教师token的覆盖;l1地面代价进一步以更保模式的加权中值取代基于均值的聚合,限制远距离传输目标的影响。两处改动分别决定匹配谁与如何聚合所选目标。我们还经顺序反向 passes 结合分布匹配与对抗精化,并利用解耦的分数网络做跨尺度蒸馏——更大的分数网络改进紧凑生成器。UVCBench、VBench、VBench-I2V与VACE基准实验显示所得四步生成器在全部三任务族与多步教师及强少步基线竞争。