论文

GLIDE:面向高效LLM推理的引导式逐层混合注意力

GLIDE: Guided Layerwise Hybrid Attention for Efficient LLM Inference

模型架构Transformer

摘要

随着大语言模型扩展到日益增长的长上下文,解码期间键值(KV)缓存的内存I/O和计算开销成为主要的吞吐瓶颈。为解决这一问题,我们提出GLIDE,一种引导式逐层混合注意力,将滑动窗口softmax注意力与线性递归聚合策略性地结合起来。GLIDE的动机来自逐层异质性:浅层对softmax移除表现出高敏感性,而更深的层则表现出冗余,能够容忍被线性替代方案激进替换。利用这一洞见,GLIDE引入逐层自适应机制,让每一层在高效的线性递归与可变大小的softmax窗口之间取得平衡。与统一混合方法不同,GLIDE在整个模型中非均匀地压缩softmax占用,在降低KV缓存总体I/O的同时,在最关键之处保留表达能力。实证评估表明,GLIDE实现了更优的性能-效率权衡,在不损害质量的前提下降低了长上下文生成的端到端延迟。

GLIDE:面向高效LLM推理的引导式逐层混合注意力:论文配图
((a)) ((b)) 图 1:Glide 的分层自适应注意力策略。 (a) 注意力机制:Glide 策略性地从早期层的 softmax 注意力(红色)过渡到更深层的线性注意力(绿色),将昂贵的计算集中在最关键的地方,这与普通的 softmax、滑动窗口注意力(SWA)或纯线性方法不同。 (b) Pareto 分析:Glide 配置实现了比基线 LLaMA 低 45×45\times – 62×62\times 的 KV 缓存 I/O,同时保留 92%92\% – 96%96\% 的准确度,通过利用分层异构性优于统一替代方案(SWA、混合模型)。