Causal-rCM:流视频生成和交互式世界模型中自回归扩散 蒸馏 的统一教师强制和自强制开放配方
Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models
摘要
具有因果扩散的自回归视频扩散 Transformer 已成为实时流视频生成和动作条件交互式世界模型的主要范例。在这项工作中,我们将 rCM(一种先进的扩散 蒸馏 框架)扩展到自回归视频扩散。 rCM的核心理念在于正向散度和反向散度之间的互补性,分别用扩散蒸馏中的一致性模型(CM)和分布匹配蒸馏(DMD)来表示。这种哲学自然地延续到自回归环境中,其中教师强制(TF)提供离线、前向发散因果训练范式,而自我强制(SF)对应于 同策略、反向发散细化。我们的贡献是:(1)通过广泛的实验,我们表明教师强制 CM 目前是自强制 DMD 作为初始化策略的最佳补充(2)我们提出了第一个用于自回归视频扩散的基于教师强制的连续时间 CM(例如 sCM/MeanFlow),由我们的自定义掩模 FlashAttention-2 JVP 内核启用,与离散时间 CM 相比,实现了 10$\times$ 更快的收敛速度(dCM) (3) 我们引入 Causal-rCM,这是一种领先的、统一的、可扩展的算法基础设施开放配方,用于扩散 蒸馏 和因果训练 (4) 我们仅使用合成数据进行训练,在逐帧和逐块设置中实现了最先进的流视频生成性能。值得注意的是,我们精炼的 2 步因果 Wan2.1-1.3B 模型仅用 1 或 2 个采样步骤即可获得 84.63 的 VBench-T2V 分数。我们进一步将 Causal-rCM 应用到 Cosmos 3 中,Cosmos 3 是一种先进的全模态世界基础模型,用于物理 AI,具有动作条件生成功能,从而实现交互式世界模型。