论文
FreeSpec:通过奇异谱重建生成 无需训练 长视频
FreeSpec: Training-Free Long Video Generation via Singular-Spectrum Reconstruction
摘要
视频扩散模型在短视频合成中表现良好,但其对长视频的 无需训练 扩展经常会遇到内容漂移、时间不一致和过度平滑动态的问题。现有方法通过将全局分支与局部分支相结合来提高时间一致性,但它们通常使用预定义的标准进一步分解每个分支内的外观一致性和时间动态。当外观和动作进程紧密耦合时(例如在相机运动和顺序运动中),此分配是不可靠的。我们从奇异频谱的角度分析了视频时间扩展问题,并表明扩大的自注意力窗口会导致频谱集中:频谱能量由一些低秩奇异方向主导,保留粗糙结构,但抑制高阶空间细节和运动丰富的时间变化。为了缓解这个问题,我们提出了 FreeSpec,一个用于长视频生成的 无需训练 频谱重建框架。 FreeSpec通过奇异值分解来分解全局和局部特征,并使用全局分支作为低秩谱指导和局部分支作为高秩重建基础。这种谱级融合避免了先前分解规则的严格特征划分,保持了远程一致性,同时更好地保留了空间细节和时间动态。 Wan2.1 和 LTX-Video 上的实验表明,FreeSpec 改进了长视频生成,尤其是时间动态,同时保持了强大的视觉质量和时间一致性。项目演示:https://fdchen24.github.io/FreeSpec-Website/。