论文
GQLA:用于硬件自适应 大语言模型 解码的组查询潜在注意力
GQLA: Group-Query Latent Attention for Hardware-Adaptive Large Language Model Decoding
摘要
多头潜在注意力(MLA)是 DeepSeek-V2/V3 中使用的注意力,将键和值联合压缩为低秩潜在注意力,并几乎完美地匹配 H100 屋顶线。然而,其经过训练的权重仅公开一条解码路径(吸收式 MQA 形式),该路径将高效推理与 H100 级计算带宽比联系起来,丧失沿头轴的张量并行性,并且在商品推理 GPU(例如出口限制的 H20)上不会产生多词元预测 (MTP) 增益。我们提出了组查询潜在注意力(GQLA),这是对 MLA 的最小修改,其训练权重在相同参数上暴露了两个代数等效的解码路径:与 MLA 相同的 MQA 吸收路径,以及具有每组扩展缓存的 GQA 路径。运行时选择与目标硬件匹配的路径 - 无需重新训练,无需自定义内核 - 因此一组 GQLA 权重固定 H100 (MQA-absorb, s_q=1) 和 H20 (GQA + MTP, s_q=2) 的屋顶线,同时支持 GQA 路径上最多 8 路零冗余张量并行性。为了避免从头开始预训练,我们将 TransMLA 扩展为 TransGQLA,它将预训练的 GQA 检查点转换为 GQLA 模型;在 LLaMA-3-8B 上,它将 MQA 吸收路径上的每个词元 KV 缓存压缩到 GQA 基线的 28.125%,同时在结构上保留每个组路径上的 GQA 级别流量。