论文

划分支持,重建残差:​​无需训练 视频生成和世界模型的稀疏注意力

Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models

模型优化稀疏化

摘要

块稀疏注意力通过对查询和键进行分组以及仅在选定组之间计算注意力来加速视频 Transformer。然而,它面临两个挑战:(1)共享块路由的查询可能会关注不同的键; (2)保留大部分注意力并不一定能保留注意力输出。我们发现分区选择既影响分组查询的首选支持之间的重叠,也影响稀疏输出的仿射函数表示密集输出和稀疏输出之间差异的程度。我们介绍 SparsePR,一种将响应耦合分区与探针拟合残差重建相结合的 无需训练 方法。我们首先根据键对采样查询的响应方式对成对的键/值标记进行分组。然后,我们根据查询对结果键组质心的响应对查询进行分组,以实现共享稀疏路由。我们计算对一小组查询行的精确关注,并使用加权岭回归对它们的密集和稀疏输出之间的差异进行仿射校正。拟合的地图预测每个未探测查询的残差,我们将其添加到其稀疏输出中。我们将注意力输出误差测量为相对于每个查询的密集输出的相对 L2 误差。在四个视频生成和世界模型中,与没有残差校正的语义块稀疏注意力相比,SparsePR 将未探测查询的平均误差降低了 61.6--90.5%,执行对密度为 22%(包括精确探测)。 SparsePR 在密集注意力的基础上实现了 1.48x--2.61 倍的端到端加速,在实现的执行对密度为 21.9--26.0% 时,密集参考 PSNR 为 24.42--31.84 dB。项目页面:https://pardistaghavi.github.io/SparsePR-website/