SANA-Video 2.0:具有注意力残差的混合线性注意力,可实现高效视频生成
SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
摘要
我们推出了 SANA-Video 2.0,这是一种在统一架构下以 5B 和 14B 规模实例化的混合视频传播 Transformer。 SANA-Video 2.0 旨在在单个 GPU 上生成高达 720p 的高质量视频,其质量可与全 softmax 视频 DiT 相匹配,同时保留线性注意力有利的长序列缩放。为了避免整个过程中的二次注意力,混合线性 Softmax 注意力将 O(N) 主导混合的门控线性注意力与周期性门控 Softmax 锚点以 3:1 的比例结合起来,恢复纯线性注意力所缺乏的全秩词元交互。为了跨深度传播这些刷新的表示,块注意力残差 (AttnRes) 将完成的块摘要路由到后面的线性层,从而实现锚点特征重用并将深层有效排名提高约 12%。通过从头开始训练,SANA-Video 2.0 直接学习完整的混合模型,而不是线性化预训练模型,并通过降低分辨率的代理研究确定 25% softmax 作为最佳质量效率权衡。通过 40 步采样,SANA-Video 2.0 在单个 H100 上以 480p 的速度在 13.2 秒内实现了 84.30 的 VBench 分数,与更大的 softmax 视频 DiT 相比,其延迟仅为一小部分。其编译的 DiT 前向传播速度比 720p/60s 下匹配的 full-softmax 基线快 3.2 倍,这一差距随着视频时长的增加而扩大。此外,全栈 Sol-Engine 优化(内核融合、缓存和稀疏注意力)将这一硬件友好型骨干网络进一步加速了 3.58 倍,使 5B 管道在 720p/5 秒时达到 13.06 秒,比 H100 上的 Wan 2.2-A14B 快 120 倍。总体而言,我们的混合设计以大幅降低的成本恢复了 softmax 级别的表现力,解锁了可扩展的长高分辨率视频生成。