论文

将图像编辑器转变为视频编辑器

Transforming Image Editors into Video Editors

应用与实践内容创作

摘要

最近的图像编辑系统已经实现了令人印象深刻的语义理解、视觉保真度和指令跟踪能力,而视频编辑仍然更加困难和昂贵。在本文中,我们提出了一种端到端视频编辑的简单替代方案:我们不是训练单一的视频编辑器,而是通过基于锚点的生成将强大的图像编辑器转变为视频编辑器。我们的主要见解是,视频编辑可以分解为两个子问题:编辑一组稀疏的关键帧并跨时间传播这些编辑。基于这一观察,我们提出了基于锚点的视频编辑(AVE),这是一个两阶段框架,其中强大的图像编辑器首先对选定的关键帧进行组合编辑,然后运动引导的图像到视频扩散模型通过将编辑的关键帧视为固定锚点来生成最终视频。这种设计直接继承了现代图像编辑器的优势,同时避免了昂贵的端到端视频编辑培训。 IVEBench和VIE-Bench上的实验表明AVE在以下方面取得了强劲的性能 指令遵循、时间一致性和内容保真度。进一步的消融表明,最终的视频编辑质量与图像编辑器的质量密切相关,这表明视频编辑的未来进步可能来自于更强大的图像编辑基础和轻量级的视频传输。代码可在 https://github.com/wangf3014/AVE. 获取