论文

QK-Normed MLA:没有完整密钥缓存的 QK 规范化

QK-Normed MLA: QK normalization without full key caching

模型架构Transformer

摘要

查询键(QK)规范化通过控制点积之前的查询和键的规模来稳定注意力,但不能立即与多头潜在注意力(MLA)兼容。 MLA 通过缓存低维潜在状态而不是完整密钥来实现高效解码,而后投影 QK RMSNorm 似乎需要每个缓存词元的完全投影密钥。我们表明这种明显的不兼容性是一个实现工件,而不是架构约束。 RMSNorm 分解为静态仿射权重和动态标量 RMS 统计量。静态键端权重可以被吸收到 MLA 查询端投影中;动态密钥统计量减少到每个词元和 KV 组一个逆 RMS 标量。所得公式与精确算术中的显式后投影 QK RMSNorm 完全相同,并保留了 MLA 的潜在解码路径。在针对高达 100B 词元进行训练的 400M 运行中,QK-Normed MLA 实现了比 QK 裁剪更低的训练损失和更好的下游精度,而 H800 解码基准测试显示,在高达 256k 上下文的情况下,延迟开销不到 2%。这些结果使得 QK 归一化成为 MLA 模型的实用稳定选项,而无需全密钥缓存。