论文
DCARL:自回归长轨迹视频生成的分治框架
DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation
摘要
长轨迹视频生成对于世界建模来说是一项至关重要但具有挑战性的任务,这主要是由于现有视频扩散模型(VDM)的可扩展性有限。自回归模型虽然提供无限的滚动生成,但存在视觉漂移和可控性差的问题。为了解决这些问题,我们提出了 DCARL,一种新颖的分治自回归框架,它有效地将分治方案的结构稳定性与 VDM 的高保真生成结合起来。我们的方法首先采用未经时间压缩训练的专用关键帧生成器来建立远程、全局一致的结构锚点。随后,插值生成器以自回归方式与重叠片段合成密集帧,利用全局上下文的关键帧和用于局部连贯性的单个干净的前一帧。在大规模互联网长轨迹视频数据集上进行训练后,与最先进的自回归和分而治之基线相比,我们的方法在视觉质量(较低的 FID 和 FVD)和相机依从性(较低的 ATE 和 ARE)方面实现了卓越的性能,展示了长度长达 32 秒的长轨迹视频的稳定和高保真生成。