论文
流媒体视频编辑,轻松适配
Streaming Video Editing with Easy Adaptation
摘要
在本文中,我们提出了 SVEET,这是一个仅需要对预训练的双向视频扩散模型进行训练的框架,但支持以自回归方式进行高质量的流媒体视频编辑。为了解决这个问题,我们首先系统地重新审视现有的视频到视频扩散方法,并确定这种流适应的两个关键原则:骨干特征解缠和条件帧独立性。基于这些见解,我们开发了一种用于可控视频生成的新颖范例。其核心是,辅助模型分支使用时间独立的自注意力对源视频输入进行编码,并将中间特征注入到相应的主干块中以实现流兼容控制。此外,为了弥合双向模型和流模型的特征空间之间的差异,我们提出了一种解耦训练方案,该方案明确强制视频可控性和模型因果关系的优化方向之间的正交性。这种解开确保了推理时两个目标之间的兼容性,并促进跨异构骨干架构的平稳零样本知识传输。大量实验表明,SVEET 在保持实时性能的同时实现了卓越的编辑质量,在单个 H100 GPU 17 上实现了 15 FPS,无需任何辅助加速技术。代码可从此 https URL 获取。