论文
HLA:循环语言模型的混合潜在注意力
Hybrid Latent Attention for Looped Language Models
摘要
循环语言模型将相同的层堆栈 T 次应用于每个 token,这在不添加参数的情况下加深了模型,但将其键值 (KV) 缓存乘以 T。较大的缓存限制了 GPU 一次可以解码的序列数量,并减慢了读取整个缓存的每个解码步骤。我们提出混合潜在注意力(HLA),它将精确的键和值保留在 W 最近的 token 的滑动窗口内,并将每个较旧的 token 存储为每个循环的查询直接读取的紧凑潜在,而无需重建键和值。我们使用 1.4B 和 2.6B 参数在 Ouro 循环模型 (T=4) 上训练 HLA,保持预训练权重冻结,而训练仅添加参数来重现原始注意力。每个 token 的缓存缩小了 10.7 倍,每个 GPU 的并发序列数提高了 4.0-8.8 倍,解码吞吐量在 1K-token 上下文中提高了 2.5 倍,在 16K 时提高了 7.4 倍。 HLA 在数学、知识和推理基准方面保留了超过 97% 的原始准确性,在高达 16K token 的长上下文检索上保留了 96-100% 的准确性。经过监督微调后,它在竞赛级数学上的表现与经过微调的原始模型相当。