论文

MilliVid:视频生成中远程一致性的分层潜伏

MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation

模型推理解码与生成控制

摘要

视频生成模型变得越来越强大,但实现远程一致性仍然具有挑战性,因为即使是几十帧也需要不切实际的长 Transformer 序列长度。我们表明,可以通过在多尺度词元空间内使用从粗到细的采样轨迹生成视频来缓解这个问题。我们的方法很简单:首先,我们预训练一个自动编码器,将每个帧压缩为词元层次结构,级别范围从典型的潜在分辨率到每帧仅少数词元。最粗糙的级别捕获最重要的信息,例如场景布局和语义,而更精细的级别添加高频外观和纹理。然后,我们训练视频扩散模型以使用从粗到细的采样轨迹来生成这些标记。通过在每个采样轨迹步骤中仔细控制生成帧并将其用作上下文的细节级别,我们能够保持几何形状和对象持久性的远程一致性,同时在感知相关细节的远程一致性上花费更少的计算。我们使用 Minecraft 长视频的自定义数据集验证了这种方法,与现有基线相比,它产生了更加一致的采样轨迹。