论文
上下文强制:揭示自回归视频扩散中的上下文效应
In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion
摘要
当前的少步自回归视频扩散模型依赖于先前完全去噪的干净帧作为当前帧的所有去噪步骤的上下文。然而,这些干净的帧泄漏了过多的局部细节,导致模型走捷径,导致时间语义和动态受到损害。受到扩散作为掩蔽的观点的启发,我们探索了噪声环境对少步自回归生成的影响。然而,简单地应用具有相同噪声水平的上下文提供的指导不足,导致时间一致性较差。为了解决这个困境,我们引入了上下文强制,这是一种渐进式自回归范式,利用噪声水平降低的上下文。通过对远处的帧应用更少的掩蔽,对相邻的帧应用更多的掩蔽,这种方法提供了自适应指导,有效地确保了鲁棒的时间一致性和高帧间动态。此外,通过解耦对先前干净帧的严格依赖,我们的范例可以实现跨帧并行去噪,在不牺牲性能的情况下实现显着的推理加速。 VBench 上的大量实验表明,我们的方法在视觉保真度和推理速度方面都显着优于最先进的方法。