论文
等价错觉:KV 缓存自回归推理中的系统 FP16 发散
The Illusion of Equivalence: Systematic FP16 Divergence in KV-Cached Autoregressive Inference
摘要
KV 缓存是自回归 Transformer 推理中普遍存在的优化,长期以来被认为在数值上等同于无缓存计算。此假设在标准 FP16 精度下失败:高速缓存开启和高速缓存关闭执行路径采用不同的浮点累积顺序,由于 FP16 非关联性,在解码的词元序列中产生确定性分歧。在 GSM8K 上评估的三个开放权重模型(LLaMA-2-7B、Mistral-7B-v0.3、Gemma-2-2B)中,我们观察到所有采样策略的词元发散率为 100%,包括贪婪解码,这排除了采样随机性的原因,并且缓存开启在 9 个条件中的 8 个条件下产生了更高的精度,其中精度差异作为发散方向是系统性而非随机性的指标。受控的 FP32 伪造将分歧减少了 8 个数量级,消除了词元翻转,并将翻转率降至恰好 0.0%,确认 FP16 非关联性是唯一的因果驱动因素。逐层漂移分析揭示了架构上可预测的传播模式:使用分组查询注意力的模型在第一层表现出明显的分歧,而 Gemma 较大的头部尺寸和滑动窗口注意力在所有层上产生均匀的积累。最后,整个残差流的激活修补无法恢复无缓存轨迹,将因果变量定位到有状态的 KV 缓存。这些发现证实 FP16 KV 缓存推理从根本上不等同于重新计算,并为理解现代 LLM 推理系统中的数值不稳定性提供了一个机制框架。