论文

DistillAlign:协调自回归视频中的模式覆盖和模式搜索 蒸馏

DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation

摘要

现有的自回归视频 蒸馏 方法通常采用基于分布匹配 蒸馏 (DMD) 的多级管道。然而,他们通常将初始化和 DMD 阶段解耦——然后追求不同的目标分布——并主要通过 VBench 等视觉分数来判断中级学生。在本文中,我们从分布的角度重新审视这种设计。考虑到分布匹配损失的模式搜索性质,良好的初始化应该与目标 DMD 教师的模式覆盖范围相匹配,而不仅仅是追求高质量。为了分析这一点,我们引入了一种分布式评估协议,用于测量共享潜在空间中学生和教师分布之间的精度和覆盖范围。它暴露了视觉分数隐藏的差异:一些初始化达到了高精度但覆盖率低,导致优化不理想,而模式覆盖初始化则保留了更广泛的支持。此外,即使目标分布一致,DMD 的反向 KL 目标仍然可以在后期训练中将学生推向高概率教师区域,从而减少覆盖范围和多样性。为了解决这个问题,我们提出了联合 蒸馏,它将 DMD 的模式搜索目标与基于一致性 蒸馏 的模式覆盖约束相结合。实验表明,我们的方法提高了生成质量、覆盖率和多样性;值得注意的是,即使使用 Wan-1.3B DM​​D 教师,它的性能也优于使用 Wan-14B 改进的基线,强调了自回归视频 蒸馏 中分布对齐的重要性。