论文

Diff-VF:无需训练 通过扩散模型生成高质量长视频

Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model

模型推理解码与生成控制

摘要

最近,扩散模型在视频生成方面取得了巨大进展。然而,大多数现有的视频扩散模型都是用短视频进行训练的,当外推到长视频时就会退化,难以在保留不同运动的同时保持远程时间连贯性。为了生成一致、高质量和动态的长视频,我们提出了 Diff-VF,这是一种 无需训练 即插即用且与模型无关的框架,可将现有的短视频扩散主干转换为长视频生成器,而无需修改或 微调 基本模型。 Diff-VF 结合了三种互补策略:用于约束全局语义的混合噪声初始化 (HNI)、用于消除窗口间不连续性的加权窗口采样 (WWS) 以及用于通过时间步长变化融合建立远程依赖关系的时域扩展采样 (TES)。我们通过跳过残差指导进一步将 Diff-VF 扩展到长视频增强,通过依赖于时间步长的指导来平衡保真度和真实感。 VBench-Long 评估结果表明,与基础模型和最近的 无需训练 长视频生成基线(包括 FreeNoise、FreeLong 和 RIFLEx)相比,Diff-VF 在时间相干性和运动多样性之间实现了更有利的平衡,同时保持了有竞争力的帧质量。对两个基本模型的实验证明了具有不同时空建模策略的视频扩散模型的适用性。广泛的消融验证了每个组件和超参数的贡献。