论文

FreqForcing:通过光谱自锚定的自回归长视频生成

FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring

模型推理解码与生成控制

摘要

自回归视频扩散模型可实现实时流视频生成。然而,自回归生成过程中引入的错误会随着时间的推移而累积,表现为颜色漂移、运动停滞和最终的视觉崩溃。在本文中,我们从频域角度描述了这种现象:误差累积表现为低频段中明显的能量漂移。我们进一步研究了频域注意力接收器的有效性,发现它在一定程度上通过减轻频谱能量漂移来提高视频质量,但不能完全解决它。受上述分析的启发,我们提出了 FreqForcing,这是一个 无需训练 框架,它通过频谱自锚定(SSA)解决长视频生成中的错误累积问题。所提出的 SSA 利用锚点注意力的低频分量来保持长视野视觉稳定性,同时通过局部注意力的高频分量保持动态运动。我们的 FreqForcing 将 5 秒片段上的 Self-Forcing 预训练扩展到两分钟生成,实现了 24 倍外推。大量实验表明,FreqForcing 在数量和质量上都优于现有的 无需训练 方法,同时与代表性的基于训练的方法保持竞争力。