论文

因果强迫++:用于实时交互式视频生成的可扩展的少步自回归扩散 蒸馏

Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation

摘要

实时交互式视频生成需要低延迟、流式传输和可控的采样轨迹。现有的自回归 (AR) 扩散 蒸馏 方法通过将双向基础模型提炼为少步 AR 学生,在分块 4 步机制中取得了很好的结果,但它们仍然受到粗响应粒度和不可忽略的采样延迟的限制。在本文中,我们研究了一种更激进的设置:仅具有 1--2 个采样步骤的逐帧自回归。在这种情况下,我们将几步 AR 学生的初始化确定为关键瓶颈:现有策略要么目标未对准,无法进行几步生成,要么扩展成本太高。我们提出 \textbf{Causal Forcing++},这是一个原则性的、可扩展的管道,它使用 \emph{因果一致性 蒸馏} (因果 CD)进行几步 AR 初始化。核心思想是因果 CD 学习与因果 ODE 蒸馏 相同的 AR 条件流图,但从相邻时间步之间的单个在线教师 ODE 步骤获得监督,从而避免了预先计算和存储完整 PF-ODE 轨迹的需要。这使得初始化更加高效并且更容易优化。由此产生的管道 \ours 在 VBench Total 中超过了 \textit{\textbf{frame-wise 2-step 设置}} 下的 SOTA 4-step chunk-wise Causal Forcing,超过了 0.1,在 VBench Quality 中超过了 0.3,在 VisionReward 中超过了 0.335,同时将第一帧延迟降低了 50\%,将第 2 阶段训练成本降低了 $\sim$$4\times$。我们本着 Genie3 的精神,进一步将管道扩展到动作条件世界模型生成。项目页面:https://github.com/thu-ml/Causal-Forcing 和 https://github.com/shengshu-ai/minWM 。