论文
Flex-Forcing:迈向统一的自回归和双向视频扩散模型
Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model
摘要
大规模生成模型的最新进展极大地推进了视频生成,但现有方法仍然受到严格的推理范式的限制。双向扩散模型在全局连贯性和视觉保真度方面表现出色,但推理速度较慢,而自回归模型以长期一致性和曝光偏差为代价提供高效的流式生成。我们引入了 Flex-Forcing,这是一个统一的训练和推理框架,使视频扩散模型能够在双向和自回归生成机制下无缝运行。核心思想是在时间轴和去噪步骤上联合定义的灵活分块机制。这种设计允许模型(1)根据不同的设备预算执行灵活的分块,(2)跨块执行双向推理以进行全局结构规划,同时在每个块内自回归生成帧以实现高效和细粒度的合成,以及(3)在没有严格因果约束的情况下执行任意顺序、任意时间步长的自回归生成。对多个视频生成基准的大量实验表明,与具有严格推理时间表的强基线相比,Flex-Forcing 始终能够实现更好的视频质量和长视频稳定性,同时提供更快的推理。