论文
通过表示对抗蒸馏增强自回归视频生成
Enhancing Autoregressive Video Generation via Representation Adversarial Distillation
摘要
少步自回归视频生成可实现高效的流合成,但早期时间块中引入的错误会被重新用作上下文,并可能通过后续rollout传播,导致细节退化、结构漂移和不稳定运动。现有的分布匹配蒸馏(DMD)主要对齐扩散潜空间中的学生和教师分布,但不提供对解码视频的感知质量的直接监督。我们引入了 Radian,一种表示空间对抗性蒸馏框架,它通过冻结视觉基础模型 (VFM) 定义的特征空间中的真实数据对抗性监督来补充on-policy DMD。在训练期间,Radian 对来自自回归学生rollout的帧进行稀疏解码,提取多级视觉表示,并应用轻量级鉴别器头来区分生成的输出和真实视频帧。 DMD 目标将学生与预先训练的教师联系起来,而表示空间对抗性目标则提供互补的感知和语义梯度,以促进高质量模式。这些额外的组件在训练后被丢弃,使生成器架构和推理时间去噪预算保持不变。 Wan2.1-1.3B 上的实验涵盖四步逐块、一步逐帧和一分钟长的自回归生成。我们的方法在四步生成下实现了 0.8444 的 VBench Total 和 0.8033 的 VideoAlign Total,并且在使用更少的去噪步骤的同时将 VBench-Long 从 Rolling Forcing 的 0.7805 提高到 0.8041。图像、视频和扩散表示之间的受控比较进一步表明,表示空间的选择会产生不同的对抗信号,并且外部 VFM 梯度比源自扩散内部特征的对抗监督更有效地补充 DMD。