论文
范围:使用在线每头 Top-K 估计进行稀疏视频注意力的子空间聚类
SCOPE: Subspace Clustering with Online Per-Head Top-K Estimation for Sparse Video Attention
摘要
扩散 Transformer (DiTs) 会导致时空词元的二次自注意力成本。现有的 无需训练 稀疏注意力方法通常从块级或集群级代理分数构建稀疏掩码,这可能会掩盖键之间的细粒度差异,并在过于稀疏的情况下错过高贡献键。此外,这样的代理分数可能会产生过于集中的 softmax 分布,导致 Top-$p$ 为某些查询集群保留太少的键。尽管固定的 Top-$k$ 最小值可以缓解这种故障模式,但共享值无法适应头和输入之间的变化。为了解决这两个限制,我们提出了 SCOPE,这是一种 无需训练 稀疏注意力框架,它将 3D-RoPE 对齐的关键子空间聚类与在线每头 Top-$k$ 估计相结合,以实现高效的视频 DiT 推理。 SCOPE 将 RoPE 后的键划分为时间、高度和宽度子空间,独立地对它们进行聚类,并通过查找表聚合相应的质心分数,以获得每个查询集群的每个键代理分数。基于现有的混合 Top-$p$/固定 Top-$k$ 选择,SCOPE 通过平均每个头内的初始保留键计数(按查询集群大小加权)在线导出特定于头的 Top-$k$ 值,并仅针对初始保留键计数低于该值的查询集群选择其他键。然后对选定的原始键和值计算稀疏注意力。在六种模型任务配置中,SCOPE 在保真度和延迟方面始终优于现有的 无需训练 基线,在 720p HunyuanVideo 上实现高达 $1.99\times$ 的端到端加速,相对于密集注意力,PSNR 为 $28.46$ dB PSNR。