论文

Transformer 注意力加速的级联词元选择

Cascade Token Selection for Transformer Attention Acceleration

模型推理推理加速

摘要

提出了一种通过利用深度上代表性集合的一致性来降低 Transformer 注意力层中代表性标记选择成本的方法。激活去相关注意力(ADA)通过 Gram 阈值在每一层选择 $r \ll T$ 代表标记,并计算压缩 $r \times r$ 问题的注意力,但选择需要在每一层有 $T \times T$ Gram 矩阵。这里介绍的级联机制继承了从$l$层到$l+1$层的代表集,通过$(T - r) \times r$跨Gram计算对其进行验证,并通过少量的添加和删除对其进行更新。选择步骤的成本从每层 $O(T^2 d)$ 下降到 $O(T r d)$。在 AMD MI300X 上对三个模型系列(GPT-2 124M、GPT-J 6B、OPT 6.7B)进行的验证表明,Gram 运算可节省 $22\%$ 至 $63\%$,连续层之间的平均 Jaccard 重叠为 $0.83$ 至 $0.94$。级联揭示了信息标记集是输入的结构属性,它在网络深度中连贯地传播:相同的标记在$l$层和$l+1$层携带非冗余信息。