论文

Open-TQ-Metal:Apple Silicon 上长上下文 LLM 推理的融合压缩域注意力

Open-TQ-Metal: Fused Compressed-Domain Attention for Long-Context LLM Inference on Apple Silicon

模型推理KV Cache

摘要

我们推出了 Open-TQ-Metal,这是 Apple Silicon 上首个融合压缩域注意力的实现,可在单个 64GB 消费类 Mac 上实现 Llama 3.1 70B 的 128K 上下文推理,这是所有现有推理框架不可能实现的配置。 Open-TQ-Metal 将 KV 缓存动态量化为 int4,并通过自定义 Metal 计算着色器直接在压缩表示上计算注意力,从而消除所有中间反量化矩阵。在跨越两个模型系列(Gemma 4 31B 和 Llama 3.1 70B)的 330 个实验中,融合的 sdpa_int4 内核在 128K 上下文中比 dequantize-then-attend 基线实现了 48 倍的注意力加速,将 KV 缓存从 40 GB 减少到 12.5 GB(3.2 倍压缩),并保持与 FP16 相同的 top-1 词元预测推论。我们进一步提供了 KV 缓存量化方法的第一个跨架构分析,揭示了注意力比例因子(而不是模型大小)决定了像 PolarQuant 这样的角度量化方案是成功还是失败,Gemma 4 的 attn_scale=1.0 将方向误差放大了 25-100 倍,比 Llama 的标准 1/sqrt(d) 缩放高出 25-100 倍。