论文

S2PD:用于物理和逻辑一致的视频生成的串行到并行扩散

S2PD: Serial-to-Parallel Diffusion for Physically and Logically Consistent Video Generation

模型推理解码与生成控制

摘要

双向视频扩散模型并行地对整个视频进行去噪,但当对来自程序生成器的有效无限分布数据进行训练时,继续违反物理定律和简单的符号规则。我们引入串行到并行扩散(S2PD),它在高噪声下执行自回归扩散,然后在低噪声下切换到并行扩散。自回归阶段提供协调相互依赖的事件并产生有效状态转换所需的串行计算,而并行阶段共同细化整个视频并减少相对于完全串行生成的采样时间。我们使用两种架构实现 S2PD:从头开始训练的像素空间扩散变换器和通过具有因果注意力的 LoRA 微调进行调整的预训练视频模型。在游戏、物理模拟和真实视频中,S2PD 比匹配的双向基线更可靠地遵循规则,并生成比其他串行方法具有更高时间稳定性和采样效率的视频。

S2PD:用于物理和逻辑一致的视频生成的串行到并行扩散的原论文方法或结果图
图 1:串行优于并行生成。我们的方法更好地保留了所有数据集中的游戏规则、物理动力学和对象一致性。红色覆盖定位了生成的样本中的错误。