论文
RoPeSLR:3D RoPE 驱动的稀疏低秩注意力,实现高效扩散 Transformer
RoPeSLR: 3D RoPE-driven Sparse-LowRank Attention for Efficient Diffusion Transformers
摘要
Diffusion Transformer (DiTs) 彻底改变了高保真视频生成,但其 $\mathcal{O}(L^2)$ 注意力复杂性为长序列合成带来了巨大的瓶颈。虽然最近的稀疏线性注意力混合体旨在缓解这一问题,但由于“RoPE 困境”,它们的性能在极度稀疏的情况下严重下降:标准线性注意力无法保留 3D 旋转位置嵌入 (RoPE) 的正交相对位置结构,从而抵消了重要的距离感知。为了解决这个问题,我们提出了 \textbf{RoPeSLR},一种 3D RoPE 引导的稀疏低秩注意力框架。我们确定,在经过经验验证的假设下,DiT 注意力流形允许解耦为高频语义尖峰集(以 $\mathcal{O}(L^{3/2})$ 稀疏性为界)和极低秩 ($\mathcal{O}(d_h \log L)$) 背景连续体。在这种结构先验的指导下,RoPeSLR 避开了标准线性注意力,采用配备可学习 3D 绝对位置嵌入 (PE) 注入的头部低秩参数化,无缝合成长程相对距离衰减。通过保证次二次稀疏性和次线性排名增长,RoPeSLR 特别适合扩展到超长视频推理。广泛的评估验证了这种可扩展的优势:在 90% 的稀疏度下,RoPeSLR 在 Wan2.1-1.3B 上实现了高达 $10\times$ 的 FLOP 减少,并在 HunyuanVideo-13B 的超长 100K+ 词元序列上提供了 $2.26\times$ 的端到端推理加速,同时保持近乎无损的生成保真度(低于1.3\% 平均 VBench 性能下降)。