论文
LayerBoost:层感知注意力减少以实现高效 LLM
LayerBoost: Layer-Aware Attention Reduction for Efficient LLMs
摘要
Transformer 主要依赖于 softmax 注意力,它引入了序列长度的二次复杂度,并且仍然是高效推理的主要瓶颈。先前关于线性或混合注意力的工作通常会在所有层上统一取代 softmax 注意力,这通常会导致性能显着下降或需要大量的重新训练才能恢复模型质量。这项工作提出了 LayerBoost,这是一种层感知的注意力减少方法,可根据各个 Transformer 层的敏感性选择性地修改注意力机制。它首先对预训练模型进行系统敏感性分析,以识别对于维持性能至关重要的层。在此分析的指导下,可以应用三种不同的策略:在高度敏感的层中保留标准的 softmax 注意力,在中等敏感的层中用线性滑动窗口注意力替换它,以及在表现出低敏感度的层中完全消除注意力。为了在这些架构修改后恢复性能,我们引入了一个基于 蒸馏 的轻量级修复阶段,仅需要 10M 额外的训练词元。 LayerBoost 减少了推理延迟,在高并发时将吞吐量提高了 68%,同时保持了具有竞争力的模型质量。它在多个基准上与基本模型性能相匹配,在其他基准上仅表现出轻微的退化,并且显着优于最先进的注意力线性化方法。这些效率提升使我们的方法特别适合高并发服务和硬件受限的部署场景,其中推理成本和内存占用是关键瓶颈。