论文

整数不在场:本地化 INT8 量化 LLM 推理中的跨内核分歧

The Integer Alibi: Localizing Cross-Kernel Divergence in INT8-Quantized LLM Inference

模型评测鲁棒性、公平性与可信度评测

摘要

实现相同缩放 INT8 GEMM 接口的两个 GPU 内核通常被视为可互换。我们测试这个假设:保持检查点、提示、硬件、推理引擎、解码和量化配置固定,我们仅交换 vLLM 内的 INT8 线性内核(CUTLASS 与 Triton)。在 1.7B 时,每个臂在冷重启时逐位复制自身,但在我们运行的任何端到端比较中,臂在顺序上没有达成一致(0/8、0/16 和 0/64)。使这个不仅仅是基准差异的是整数不在场:对于经过验证的无溢出界限下的共享 INT8 操作数,INT32 点积是精确的且与顺序无关,因此累加器不能成为任何差异的来源。从 Qwen3-1.7B 和 8B 的每个线性层(196 和 252 层)向两个内核提供相同的操作数,我们在二次方尺度下发现位相同的输出,确认固定预测列表 196/196 和 252/252(在 1.7B 预注册,在 8B 固定但不是盲),并观察到在检查站的真实规模。这将分歧定位到缩放应用程序和精确累加器之后的输出舍入。作为探针检查点,相同的干预可以恢复端到端的按位一致性(8/8 和 16/16 序列)。交叉实现 FP8 GEMM 显示出不同的特征:差异的普遍性和程度随着减少深度而增长,而 INT8 分数保持在百万分之一,并且在 K 的 64 倍范围内保持在一个间距内。教师强制重放将层与词元联系起来:翻转集中在较小的 logits 边缘,它预测 16,384 个位置上的翻转风险为 ROC-AUC 0.94。我们将发布预注册、每层预测、带有内核选择证据的清单,以及将这些控制转化为内核可互换性的具体检查的一致性程序。