论文
运行时认证的有界误差量化注意力
Runtime-Certified Bounded-Error Quantized Attention
摘要
KV 缓存量化降低了长上下文 LLM 推理的内存成本,但引入了通常仅凭经验验证的近似误差。现有系统依赖于平均情况的稳健性,没有在运行时检测故障或从故障中恢复的机制。我们提出了一种分层 KV 缓存架构,可实现运行时认证的注意力:INT8 键和 INT4 值存储在 GPU 内存中,而 FP16 原始值保留在系统 RAM 中以实现确定性回退。两项误差分解产生(i)关键量化引起的注意力分布失真和(ii)值重建误差的每头、每步界限。这些边界是在线计算的,并用于驱动自适应精度选择和多级后备梯,这保证了在需要时恢复到精确的密集注意力输出。在 LLaMA~3.1-8B 上的 PG-19、NIAH 和 RULER 基准测试中,上下文高达 128K,该系统在语言建模和检索任务的噪声中匹配密集的 FP16 KV 质量,同时恢复在朴素 INT8/INT4 基线中观察到的灾难性故障。短上下文中的值敏感任务暴露了压缩和保真度之间的受控权衡,可以通过更严格的值容差或 FP16 值回退来消除这种权衡。该认证是本地的(每头、每步),不保证端到端模型的正确性,但确保每个注意力计算要么相对于 FP16 参考有界,要么通过回退精确恢复。这将 KV 缓存量化重新构建为运行时验证的计算,而不是固定的近似值。目标不是原始加速,而是在严格的质量限制下实现积极的 KV 压缩的安全部署。