通过重新利用图像编辑模型进行基于指令的视频编辑
Instruction-Based Video Editing by Repurposing an Image Editing Model
摘要
基于指令的视频编辑通常建立在视频预训练的生成主干上:视频扩散 Transformer 以相当大的成本进行调整,以适应源视频和编辑指令。在本报告中,我们探索了一条不同的路线,并表明强大的基于指令的图像编辑模型可以通过直接对视频 VAE 潜伏进行操作来编辑视频。从 Qwen-Image-Edit 开始,我们将 Wan~2.1 视频 VAE 的潜在帧排列为一个大型虚拟图像的图块,对每个图块重复使用编辑器的图像位置编码,并使用一对从编辑器自己的 patchify 和 unpatchify 层热启动的轻量级输入/输出投影桥接两个潜在空间,以便在初始化时将(静态)视频完全嵌入为模型已经理解的图像。然后整个系统在公共 Ditto-1M 编辑三元组上进行微调,Wan~2.2 的一些去噪步骤用作可选的时间增强器。我们通过一系列零训练观察来激励设计:库存图像编辑器已经编辑了作为联系表呈现的视频;它与工作表的标记是来自一个联合编码还是来自隐藏空间中缝合的每帧编码无关;它甚至可以将真正的视频潜在零镜头编辑到清晰可辨的程度,只留下 微调 的保真度差距需要弥补。我们的结果表明,尽管在训练视频潜在空间方面投入了大量资金,但每帧视频潜在空间仍然足够接近成熟图像编辑先验以最小适应进行传输的图像域。项目页面:https://yunpeng1998.github.io/Qwen-Video-Edit-Page 代码:https://github.com/yunpeng1998/Qwen-Video-Edit 模型:https://huggingface.co/yunpeng1998/Qwen-Video-Edit