论文

LongLive-2.0:用于长视频生成的 NVFP4 并行基础设施

LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation

AI 基础设施分布式训练基础设施

摘要

我们推出了 LongLive-2.0,这是一种基于 NVFP4 的并行基础设施,贯穿长视频生成的完整训练和推理工作流程,解决速度和内存瓶颈。对于训练,我们引入了序列并行自回归(AR)训练,实例化为 Balanced SP,它通过在每个等级上配对干净历史和噪声目标时间块,共同设计高效的教师强制布局与 SP 执行,从而通过 SP 感知分块 VAE 编码实现自然的教师强制掩模。与 NVFP4 精度相结合,降低了 GPU 内存成本,并加速了训练过程中的 GEMM 计算,其比例随着视频长度的增长而增加。此外,我们表明高质量的基础设施和数据集可以实现非常干净的训练管道。与依赖 ODE 初始化和后续分布匹配 蒸馏 (DMD) 的现有 Self-Forcing 系列方法不同,LongLive-2.0 直接将扩散模型调整为长、多镜头、交互式自回归 (AR) 扩散模型。它可以进一步转换为具有独立 LoRA 权重的实时生成(4 到 2 个降噪步骤)。对于 Blackwell GPU 上的推理,我们启用 W4A4 NVFP4 推理,将 KV 缓存量化为 NVFP4 以节省内存,并通过异步流 VAE 解码提高端到端吞吐量。在非 Blackwell GPU 架构上,我们部署 SP 推理以匹配 Blackwell GPU 上的速度,而量化 KV 缓存可以降低 SP 的 GPU 间通信。实验表明,训练加速高达 2.15 倍,推理加速高达 1.84 倍。 LongLive-2.0-5B 实现了 45.7 FPS 推理,同时在基准测试中获得了强劲的性能。据我们所知,LongLive-2.0是第一个用于长视频生成的NVFP4训练和推理系统。