论文

塔克注意力:近似注意力机制的推广

Tucker Attention: A generalization of approximate attention mechanisms

模型架构Transformer

摘要

为了减少多头自注意力(MHA)中自注意力机制的内存占用,催生了丰富的方法组合,例如组查询注意力(GQA)和多头潜在注意力(MLA)。这些方法利用跨嵌入维度或注意力头的专门低秩分解。从经典低秩近似的角度来看,这些方法是非常规的,并提出了它们真正近似哪些对象以及如何解释所得表示的低秩行为的问题。为了回答这些问题,这项工作提出了自注意力层中权重对象的广义视图和分解策略,这使我们能够构建一个参数有效的方案,称为塔克注意力。正如在 LLM 和 ViT 测试用例中评估的那样,与 GQA 和 MLA 相比,Tucker Attention 需要的参数要少一个数量级才能实现可比较的验证指标。此外,Tucker Attention~包含 GQA、MLA、MHA 作为特殊情况,并且与 flash-attention 和旋转位置嵌入 (RoPE) 完全兼容。这种泛化策略可以深入了解 MHA、GQA 和 MLA 所实现的实际秩,并进一步简化 MLA。