论文

Delta-Matching:补齐大语言模型原生8位训练的注意力精度差距

Delta-Matching: Closing the Final Gap of Native 8-bit Training for LLMs

摘要

可靠的 FP8 注意力仍然是完全原生的 8 位大语言模型训练的障碍。我们推导了前向与反向不一致如何产生陈旧的增量,并凭经验证明它如何扭曲训练动态。我们的 stale-delta 混合运行在 569M 参数处显示出适度的损失差距,但在 1.67B 和 5.29B 处损失大幅增加且下游退化。 QK 归一化、NoPE(无位置编码)和较低学习率的上下文扩展可以减轻或延迟退化,但不会消除退化。这种模式表明较小的模型和短期运行可以掩盖累积的优化误差。我们提出了 Delta-Matching,证明它在所述数值假设下恢复了 softmax 梯度的逐行求和为零的不变量。它在每个前向和后向注意力核心 matmul 中实现原生按块缩放FP8,无需架构更改、更小的全局批次或辅助前向输出。在经过测试的架构、规模和训练阶段中,Delta-Matching 与 BF16/FP32 混合精度训练损失和整体下游性能相匹配。我们将发布实现代码、训练模型和数据配方。