论文
S2PD:用于物理和逻辑一致的视频生成的串行到并行扩散
S2PD: Serial-to-Parallel Diffusion for Physically and Logically Consistent Video Generation
摘要
双向视频扩散模型并行地对整个视频进行去噪,但当对来自程序生成器的有效无限分布数据进行训练时,继续违反物理定律和简单的符号规则。我们引入串行到并行扩散(S2PD),它在高噪声下执行自回归扩散,然后在低噪声下切换到并行扩散。自回归阶段提供协调相互依赖的事件并产生有效状态转换所需的串行计算,而并行阶段共同细化整个视频并减少相对于完全串行生成的采样时间。我们使用两种架构实现 S2PD:从头开始训练的像素空间扩散变换器和通过具有因果注意力的 LoRA 微调进行调整的预训练视频模型。在游戏、物理模拟和真实视频中,S2PD 比匹配的双向基线更可靠地遵循规则,并生成比其他串行方法具有更高时间稳定性和采样效率的视频。
