论文
ImVideoEdit:通过 2D 空间差异注意力块进行图像学习视频编辑
ImVideoEdit: Image-learning Video Editing via 2D Spatial Difference Attention Blocks
摘要
当前的视频编辑模型通常依赖于昂贵的配对视频数据,这限制了它们的实际可扩展性。本质上,大多数视频编辑任务可以被表述为解耦的时空过程,其中预训练模型的时间动态被保留,而空间内容被选择性地、精确地修改。基于这一见解,我们提出了 ImVideoEdit,这是一个完全从图像对学习视频编辑功能的高效框架。通过冻结预先训练的 3D 注意力模块并将图像视为单帧视频,我们解耦了 2D 空间学习过程,以帮助保留原始的时间动态。我们方法的核心是预测更新空间差异注意力模块,它逐步提取和注入空间差异。我们不依赖严格的外部掩码,而是采用文本引导的动态语义门控机制来进行自适应和隐式文本驱动的修改。尽管仅对 13K 图像对进行 5 个 epoch 的训练,且计算开销极低,但 ImVideoEdit 实现的编辑保真度和时间一致性与在大量视频数据集上训练的大型模型相当。