论文

测量和减少语言模型中的跨供应商不匹配

Measuring and Reducing Cross-Vendor Mismatch in Language Models

AI 基础设施模型部署

摘要

即使模型权重和输入相同,在不同的图形处理单元 (GPU) 供应商上运行相同的语言模型也会产生不同的逻辑。我们分析了两个密集模型和两个专家混合 (MoE) 模型中的跨供应商不匹配,该模型具有五个指标系列,即按位相等、logit 差异、top-K 一致性、token一致性和任务准确性。我们将不匹配的根源之一追溯到供应商矩阵指令内的累积顺序。向上转换到 FP32 在三倍运行时间下将密集模型的 logit 误差降低了 43%,但仅保留 BF16 中的 MLP 在 1.3 倍运行时间下保留了 94% 的增益,因此完全向上转换的大部分成本几乎买不到。在MoE模型中,FP32和FP16都降低了概率误差,但提高了logit误差并改变了专家选择,而FP16在密集模型中失败了。输出头低秩适配器 (LoRA) 也无济于事,因为最终的隐藏状态无法预测不匹配。这种不匹配也会影响到训练。固定每个种子后,从 AMD 上运行的教师模型中提取的学生模型会回答 431 个 MMLU 问题,这与从 NVIDIA 上运行的相同教师模型中提取的学生模型的答案不同。在 FP32 向上转换下,按位相等几乎没有变化,而输出分布大部分移动到参考,因此通过单一度量来判断跨供应商协议会误读其成本和收益。代码可在 https://github.com/crova-project/crova. 获取

测量和减少语言模型中的跨供应商不匹配的原论文方法或结果图
图 2:Jais 密集模型(Jais Team,2026,a-d)和 OLMoE MoE 模型(Muennighoff 等人,2025,e-h)的跨供应商差异。组件 (a/e) 和第一块 (b/f) 接收相同的输入。最后一个块的输出 (c/g) 和层曲线 (d/h) 使用独立的完全前向,允许差异传播。曲线显示了所有token和每个块输出的隐藏特征的平均绝对差。