论文

OSP-Next:利用稀疏序列并行、HiF8 量化和强化学习高效生成高质量视频

OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning

模型架构Transformer

摘要

Diffusion Transformer 实现了强大的视频生成质量,但完全注意力的二次成本限制了效率。我们引入了 OSP-Next,这是一种高效的文本到视频生成模型,集成了稀疏注意力、并行性、量化和强化学习。 OSP-Next 使用混合全稀疏注意力架构,其中稀疏组件是通过 Skiparse-2D Attention 实现的。这种固定模式机制沿空间维度应用 token-wise 和 group-wise 稀疏注意力,利用局部性,同时保持与 FlashAttention 内核的本机兼容性。基于 Skiparse-2D Attention 中重排的局部等价性,我们进一步提出稀疏序列并行(SSP),它跨等级划分子序列并通过单个 All-to-All 通信切换稀疏模式。与 Ulysses Sequence Parallelism (SP) 相比,SSP 提供了稀疏注意力的原生并行策略,并减少了 75% 的通信量。 OSP-Next还结合了HiF8量化,以实现8位量化和稀疏微调的稳定联合训练,并应用Mix-GRPO 后训练来提高稀疏模型的性能。实验表明,OSP-Next 的 VBench 总分达到 83.73%,超越了 Wan2.1 基线。在 5 秒 720P 和 5 秒 768P 设置下,OSP-Next 在 NVIDIA H200 GPU 上实现了高达 1.64$\times$ 的单 GPU 加速和超过 1.52$\times$ 的八 GPU 加速。此外,在VBench总分仅下降0.4%的情况下,OSP-Next-HiF8在单台Ascend 950PR上的两种设置下分别实现了1.69$\times$和2.27$\times$的加速,展示了OSP-Next跨硬件平台的效率和性能。