论文

条件残差预测:在没有双向教师的情况下改进自回归视频扩散

Conditional Residual Prediction: Improving Autoregressive Video Diffusion without a Bidirectional Teacher

模型训练预训练

摘要

因果视频扩散模型自回归生成视频,适合流媒体、交互式和长视频生成。然而,在标准训练下,它们的生成质量通常低于相同大小的双向模型。许多现有方法通过从预训练的双向教师中初始化或提炼来解决这一差距。相反,我们从图像模型初始化中训练因果模型,在任何阶段都没有双向视频模型。因为这条路径既不需要大型的双向教师,也不需要复杂的蒸馏管道,所以它更简单且更具可扩展性。在这条路径上,我们发现在真实历史上训练的因果模型变得强烈依赖于它,因此在其自身生成的历史中的推理错误向前传播。我们假设这种依赖性在很大程度上是不必要的,因为当前的输入已经决定了历史提供的大部分内容。我们提出了条件残差预测(CRP),这是一种减少模型对条件依赖的简单方法:模型首先预测目标,而无需 条件,并且该条件只能在此预测之上添加残差。应用于历史时,CRP 使模型尽可能地预测当前的每个块,并仅将过去的数据用于当前无法提供的内容。在对照实验中,CRP 几乎缩小了与在相同设置下训练的双向模型 6.14 点的差距。为了扩展这个方案,我们训练了 Optica,这是一个 2B 参数因果视频模型,它可以自回归生成 5 秒 480p 视频,并且仅用大约 1500 万个训练视频就在 VBench 上达到了 82.78。