论文
STS:具有投机性词元稀疏性的高效稀疏注意力
STS: Efficient Sparse Attention with Speculative Token Sparsity
摘要
注意力的二次复杂度给 大语言模型 (LLM) 推理带来了严重的内存和计算瓶颈。对于需要处理数百万个词元序列的新兴代理应用程序来说,这一挑战尤其严峻。我们提出了 STS,一种不需要模型重新训练的稀疏注意力机制。 STS 利用了这样一个关键见解:较小的草稿模型识别为重要的词元可以高度预测较大目标模型的重要词元。通过集成到 推测解码 框架中,STS 重新利用草稿模型的注意力分数来动态构建 token-and-head-wise 稀疏掩模。该掩码有效地修剪了目标 LLM 中昂贵的注意力计算。我们的评估表明,STS 在代表性基准 NarrativeQA 上以约 90% 的稀疏度运行时实现了 2.67 倍的加速,与密集注意力相比,保持了可以忽略不计的准确性下降。 STS 在稀疏性与准确性权衡方面建立了一种新的最先进技术,通过在给定的准确性预算下实现更高的稀疏性水平来超越现有技术。