论文
ClusterAttention:双向注意力的 无需训练 加速
ClusterAttention: A training-free speedup of bidirectional attention
摘要
我们引入 ClusterAttention,这是大词元计数下双向注意力的通用 无需训练 加速。我们指出当代 无需训练 方法中的两个常见假设;注意力稀疏性,以及可以利用的上下文,例如输入中的结构或多个类似的前向传递,并在失败时显示。我们提出的方法利用快速注意力感知递归聚类方法,并通过其均值补偿排除的聚类。聚类方法提供了两倍的聚类大小,允许块稀疏注意力与 GPU 吞吐量中的密集注意力相匹配。在 TabPFN-3 arXiv:2605.13986(一个没有任何假设成立的模型)上,据我们所知,ClusterAttention 是第一个比默认注意力提供大幅加速的方法,同时始终保持超过 99% 的准确性。在 TALENT 基准套件最大的数据集上,它使训练数据集的处理速度提高了近 8 倍,注意力加速速度提高了近 11 倍。 ClusterAttention 还可以与特定领域的方法竞争,同时避免任何特定领域的工程。在使用 Wan 2.1-T2V-14B arXiv:2503.20314 进行视频生成时,与该领域的领先方法 SVOO arXiv:2603.18636 相比,它以更大的加速(1.8 倍与 1.4 倍)产生更接近密集注意力的输出,两者的评估均无需离线校准。