论文

通过结构噪声初始化和指导进行基于指令的免调整视频编辑

Tuning-free Instruction-based Video Editing Via Structural Noise Initialization and Guidance

应用与实践内容创作

摘要

视频编辑提出了重大挑战。虽然一系列免调优方法避免了大量数据收集和 模型训练 的需要,但它们通常没有充分利用嵌入噪声潜伏中的丰富信息,导致结果不令人满意。为了解决这个问题,我们提出了一个 \textit{免调整、基于指令}的视频编辑框架。我们从潜在噪声的角度来处理视频编辑:我们设计了一种结构噪声初始化策略(SNIS),通过为已编辑区域分配较高的噪声级别(以促进内容更改)和为未编辑区域分配较低的噪声级别(以保持内容一致性)来确保优越的编辑起点。我们引入了噪声引导机制(NGM),它利用生成模型中的视频先验,有效地整合噪声潜伏中的丰富信息来指导去噪过程,从而保留未经编辑的内容和整体视觉连贯性。实验表明,我们提出的方法实现了更好的视觉质量和最先进的性能。