论文

InsEdit:通过数据高效的视频扩散模型适应实现基于指令的可视化编辑

InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation

应用与实践内容创作

摘要

基于指令的视频编辑是用文本控制视频内容的自然方式,但将视频生成模型适应编辑器通常需要大量数据。与此同时,高质量的视频编辑数据仍然稀缺。在本文中,我们展示了视频生成主干可以成为强大的视频编辑器,而无需大规模视频编辑数据。我们提出了 InsEdit,一种基于 HunyuanVideo-1.5 构建的基于指令的编辑模型。 InsEdit 将可视化编辑架构与基于相互上下文注意 (MCA) 的视频数据管道相结合,创建对齐的视频对,其中编辑可以从剪辑的中间开始,而不仅仅是从第一帧开始。仅使用 O(100)K 视频编辑数据,InsEdit 在我们的视频指令编辑基准测试中就取得了开源方法中最先进的结果。此外,由于我们的训练配方还包括图像编辑数据,因此最终模型无需任何修改即可支持图像编辑。