论文

上下文匹配的 蒸馏:自回归视频的教师因果关系 蒸馏

Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation

摘要

交互式自回归视频生成需要低延迟生成轨迹和精确的在线控制。少步 蒸馏 通过减少去噪步骤来加速生成,而在线控制则施加因果约束:帧和块应取决于生成期间可用的历史记录和控制。然而,与 蒸馏 (DMD) 管道匹配的现有视频分发通常使用对完整剪辑进行评分的双向教师来监督因果几步的学生。因此,目标的分数可能取决于学生生成目标时不可用的未来框架和控制,从而使教师监督与学生的因果信息集不一致。我们引入了上下文匹配 蒸馏 (CMD),这是一种因果 DMD 框架,可将教师监督与生成每个目标时可用的信息保持一致。 CMD 用因果教师取代了双向全剪辑评分,该教师可以评估每个目标,而无需访问未来的帧或控件。同一个因果教师初始化了几步学生,在教师训练、学生 蒸馏 和推理中建立了一致的因果表述。除了对齐时间信息边界之外,前缀评分还通过评估缓存的学生生成的前缀下的每个目标,将监督与学生实现的生成轨迹上下文相匹配。前缀损坏通过扰乱训练早期产生的不可靠前缀,同时保持目标上下文对齐,进一步稳定训练。通过简单的因果公式,CMD 自然地扩展到逐帧和逐块生成、长视频 蒸馏 和相机条件 蒸馏。实验证明了自回归方法在短视频和长视频基准上的最先进的总体性能,以及对时变相机控制的遵守程度的显着提高。