论文

超越一致性:在零镜头视频编辑中保留时间结构

Beyond Consistency: Preserving Temporal Structure in Zero-Shot Video Editing

应用与实践内容创作

摘要

现有的零镜头视频编辑方法依赖于预先训练的扩散模型,成功地实现了空间控制和基本的时间一致性,但从根本上无法保留视频的原始时间结构。这种区别至关重要:时间一致性保证了视觉流畅性,但时间结构决定了视频的高级叙事、节奏和语义流。如果没有这种保留,编辑后的输出,尤其是具有复杂语义变化的长视频,就会变得叙事不连贯且语义模糊。为了解决这一限制,我们引入了一种新颖的零镜头编辑方法,该方法首次明确专注于保留源视频的时间结构。我们通过基于特征相似性将视频自适应地划分为语义上不同的剪辑并为每个剪辑选择一个代表性的锚帧来实现这一点。为了提高剪辑内的保真度和计算效率,我们设计了一种剪辑自适应标记合并策略,该策略利用锚点的语义优势来稳定编辑。此外,我们采用交替组合策略,确保剪辑间无缝过渡,同时保持语义区别。大量的实验表明,我们的方法取得了最先进的结果,成功地平衡了原始时间结构的保留与计算效率,并为零镜头视频编辑保真度树立了新的基准。