论文
Vera:用于内容保留视频编辑的分层扩散模型
Vera: A Layered Diffusion Model for Content-Preserving Video Editing
摘要
视频扩散模型使视频生成和编辑取得了显着进步。然而,内容保存仍然是一个核心挑战:现有的方法会重新生成每个像素,并经常更改应保持不变的元素,例如角色或背景场景。我们介绍 Vera,一个用于保留内容的视频编辑的分层扩散框架。 Vera 不是重新生成整个视频,而是生成一个编辑层以及一个用于与源视频合成的 alpha 遮罩,通过设计将创意编辑与内容保留分开。为了鼓励与源视频的连贯合成,我们将文本到视频的 DiT 扩展为 Mixture-of-Transformer (MoT) 架构,每个层都有单独的 DiT,通过联合自注意力进行交互。为了支持 Vera 的训练,我们进一步构建了一个高质量的分层数据集,具有准确的 alpha 遮罩、多样化的场景和动态以及视觉效果。在我们的定量基准和人类偏好研究中,Vera 使用 486K 帧的分层训练数据,在内容保存方面优于领先的开源视频编辑模型,同时在编辑质量方面保持竞争力。