论文

跨 GPU 内核的确定性 LLM 推理:2 的幂 INT8 量化尺度和基于容差的一致性的限制

Deterministic LLM Inference Across GPU Kernels: Power-of-Two INT8 Quantization Scales and the Limits of Tolerance-Based Conformance

摘要

量化 GEMM 内核的一致性套件询问两个实现是否在容差范围内一致。我们测量这样一个套件可以检测到的内容。将 9 个错误注入到 Qwen3-1.7B 的 8,232 个层错误机制单元上的参考 INT8 管道中,我们发现五个尾声错误中的每一个错误(缩放精度、双舍入、乘法顺序、输出截断、融合排序)最多将输出移动一个 bfloat16 间距,并且每当它在 5,880 个单元中移动时,精确地移动输出 1。因此,一个间距的公差对于整个类的构造来说是盲目的:五个错误中的四个是通过套件中没有检查来检测到的,第五个仅在二次方尺度下检测到。违反累加器精确性前提条件或破坏操作数共享的故障都会毫无例外地被检测到,并且永远不会触发空故障。因此,这种形状的基于公差的套件所建立的范围比可互换性更窄:先决条件成立,操作数共享,并且差异保持在一个间距内。暴露检测到的一个故障的二幂约束也是可部署的。将每个权重尺度重新量化为其最接近的 2 次幂,使得 CUTLASS 和 Triton 在每个线性层上按位一致(196/196 和 252/252,相对于检查点自己的尺度下的 8/196 和 10/252),并在 1.7B、8B 和 14B 处生成字节相同的生成词元序列(8/8 提示,相对于所有三个提示的 0/8)。观察到的困惑点估计值为 +0.32%、-0.28% 和 +0.48%; 90%的间隔在两个较小尺寸处覆盖了零,但在14B处没有,达到+0.71%和+0.76%。之前报道的这种干预措施的困惑度为 157%,这是一个在不重新量化权重的情况下重写了尺度的探针的产物;分离效果将 99.8% 归因于由此产生的权重尺度不匹配,而不是二次幂约束本身。