论文
VideoRAE:通过表示自动编码器驯服视频基础模型以进行生成建模
VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders
摘要
视频生成模型通常依赖于经过像素级重建训练的 3D-VAE,其潜在空间可能无法充分代表语义结构。我们引入了 VideoRAE,一种表示自动编码器,它将来自冻结视频基础模型的特征转换为紧凑的、可重构的潜在特征以用于视频生成。轻量级 1D 自注意力投影仪压缩多尺度分层特征,通过多码本高维量化产生 Diffusion Transformer 的连续潜伏和自回归模型的离散标记。在解码过程中,局部-全局表示对齐目标从冻结的编码器传输语义结构,并消除了 KL 正则化的需要。综合实验表明,VideoRAE 在连续和离散状态下都实现了强大的重建。在 UCF-101 上,基于 VideoRAE 构建的自回归和扩散生成器分别实现了 40 和 93 的类条件 gFVD 分数,同时收敛速度比自动编码器基线快大约五倍。在受控 2B 参数文本到视频实验中,用 VideoRAE 替换 LTX-VAE 可加速收敛并持续提高 VBench 性能。这些结果将冻结视频基础表示建立为紧凑、多功能且易于生成的视频潜在特征。代码和模型可在 https://zhxie0117.github.io/VideoRAE/ 获取。