论文
循环潜在注意力:循环 Transformer 的交叉循环 KV 压缩
Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers
摘要
循环、权重绑定的 Transformer 通过重用单个块来减少参数,但解码仍然为每个重复步骤存储单独的 K/V 缓存。我们证明了这种循环索引缓存是高度结构化的。对于固定的词元、层和头,K/V 向量在循环中跟踪短的低秩轨迹,而头和层轴保持平坦得多。我们引入了 Looped Latent Attention (\lla{}),这是一种 后训练 缓存编解码器,它存储紧凑的 K 和 V 潜在向量,并仅在注意力读取它们时才重建循环特定的 K/V 向量。默认的每头编解码器压缩循环,而 \lla{}-2D 也将头折叠成一个潜在的极端压缩机制。编解码器根据教师激活的 SVD 进行初始化,并使用 logits 和注意力输出 蒸馏 进行细化。在匹配的缓存预算下,每头 \lla{} 优于头轴 MLA、跨层共享、KV 量化和最终循环重用,表明循环缓存是低秩的,但不能安全地折叠到单个状态。 Ouro-2.6B-Thinking 具有相同的轴优势,并转移到 Huginn-3.5B,其中 SVD 编解码器在独立于解码器的评估中保持近乎无损至 32\times$ 压缩。缓存减少是准确的。在一台 H200 上,潜在存储路径将 4k 环境下测得的 Ouro-1.4B 批量容量从 32 个序列增加到 768 个序列,压缩率为 21.3 倍。最后,对于 MATH-500 等长推理生成轨迹,与 词元级 离策略 蒸馏 相比,同策略 对学生生成的前缀的细化将 $4\times$ 压缩的准确性从 0.43 提高到 0.66,并减少了无答案的产生。