论文
贪婪解码不是精度不变的:LLM 推理中的交叉精度输出分歧
Greedy Decoding Is Not Precision-Invariant: Cross-Precision Output Divergence in LLM Inference
摘要
来自大型语言模型的贪婪解码通常被视为确定性的。我们证明它不是精度不变的:相同的模型、提示和解码算法在相同硬件上的 BF16 和 FP16 中产生不同的输出。在我们对六个模型(1.1B-7B 参数,四个系列;分歧另外以 12B 为特征)和三个基准的评估中,49-100% 的提示存在分歧;单个词元翻转通常会导致轨迹级别的分歧。我们进行了经验误差传播分析,发现 22 层累积的身体误差无法区分翻转和非翻转步骤;结果主要取决于 LM 头部的前两个 Logit 裕度相对于前两个候选者之间的方向扰动。该分析对干预结果做出了五项可测试的预测,包括应用更多 FP32 计算(更广泛的范围)会使一致性更差。实验符合所有五个预测。我们评估的性能最佳的低开销干预是选择性 FP32 LM 头重新计算,仅在裕度低于阈值时触发,在低批量(批量大小 <=4)单流推理中以低于 4% 的延迟开销在 A10G 上提供 +22-36 pp(在 L4 和 A100 上为 +12-21 pp)精确一致性。我们绘制了六个模型和四个批量大小的适用性边界,并假设训练时间精度稳定性是一个决定因素。该方法是一种部分缓解措施,而不是普遍的确定性保证:当主体产生的错误占主导地位时,包括批量大小 >=8 以及在我们的测试中端到端 FP8 下,它的好处就会消失。