论文

一致且可编辑:文本引导视频编辑的平衡框架

Consistent and Editable: A Balanced Framework for Text-Guided Video Editing

应用与实践内容创作

摘要

最近,扩散模型在文本引导视频编辑领域取得了相当大的成功。然而,现有的工作常常难以平衡视频编辑中的时间一致性和可编辑性之间的权衡,而一致性和可编辑性通常呈反比关系。为了解决这个问题,我们提出了一种增强一致性和可编辑性的高质量视频编辑框架,名为 EquiEdit,它协调提高了编辑视频的时间一致性和可编辑性,同时实现了两者之间的平衡。在时间一致性方面,所提出的时间Mamba模块具有定制的时间感知扫描,按照四个设计方向扫描融合视频序列,有效增强了编辑视频的帧间一致性。为了可编辑性,我们设计了一种基于频谱变换的噪声注入策略,以增加编辑灵活性,其中傅立叶变换用于保留用于编辑的初始潜在噪声中的隐藏结构,确保编辑视频的帧间一致性和输入视频的保真度。广泛的定性和定量实验证明了我们的方法在时间一致性和可编辑性方面的有效性,以及它对输入视频本身的高度保真度。