论文
CoDMD:用于快速视频生成的 Copula 感知分布匹配 蒸馏
CoDMD: Copula-aware Distribution Matching Distillation for Fast Video Generation
摘要
由于现实场景中高效部署的迫切需求,用于视频扩散模型的少步 蒸馏 引起了广泛关注。然而,分布匹配 蒸馏 (DMD) 作为一种领先范例,在有限的 NFE 预算下往往会退化,在视频生成中表现为布局不稳定、过饱和和运动动力学损坏。我们将这种失败归因于结构限制:标准 DMD 是具有坐标梯度的样本内分布匹配目标,因此对跨批元素或时间帧的关系几何没有明确的约束,从而使底层的 copula 在很大程度上不受监管。结合其反向 KL 目标的模式寻求倾向,缺乏关系指导使得 DMD 很容易在少步机制中陷入局部最优。受这一见解的启发,我们提出了 Copula-aware DMD (CoDMD),这是一种轻量级关系正则化器,它重用由冻结教师和在线假模型已经生成的分数估计来构建跨样本和帧的成对关系矩阵。这些通过补充分布目标进行匹配,不需要额外的网络、数据集或采样轨迹。在 1.3B 和 14B 尺度的 Wan-2.1-T2V 模型系列上,CoDMD 将 50 步教师提炼为 4 步学生,实现了大约 25$\times$ 加速,同时获得 84.46 和 84.87 的 VBench 分数,优于先前基于轨迹的(rCM 82.81 和 84.05)和基于分布的(DMD) 83.38 和 83.81) 方法。