论文
GLIDE:面向高效LLM推理的引导式逐层混合注意力
GLIDE: Guided Layerwise Hybrid Attention for Efficient LLM Inference
摘要
随着大语言模型扩展到日益增长的长上下文,解码期间键值(KV)缓存的内存I/O和计算开销成为主要的吞吐瓶颈。为解决这一问题,我们提出GLIDE,一种引导式逐层混合注意力,将滑动窗口softmax注意力与线性递归聚合策略性地结合起来。GLIDE的动机来自逐层异质性:浅层对softmax移除表现出高敏感性,而更深的层则表现出冗余,能够容忍被线性替代方案激进替换。利用这一洞见,GLIDE引入逐层自适应机制,让每一层在高效的线性递归与可变大小的softmax窗口之间取得平衡。与统一混合方法不同,GLIDE在整个模型中非均匀地压缩softmax占用,在降低KV缓存总体I/O的同时,在最关键之处保留表达能力。实证评估表明,GLIDE实现了更优的性能-效率权衡,在不损害质量的前提下降低了长上下文生成的端到端延迟。
