论文

了解LLM训练中后训练量化的权重平均机制

Understanding the Weight Averaging Mechanism in LLM Training for Post-Training Quantization

摘要

大语言模型 (LLM) 通常在高精度中进行预训练,但越来越多地使用低精度后训练量化 (PTQ) 进行部署。最近的研究表明,与学习率衰减相比,在预训练期间使用权重平均可以提高 PTQ 性能,这表明它可能提供一种简单的方法来改善预训练到量化的过渡。但权重平均背后的机制仍未得到充分解释。这会导致性能增益不一致且脆弱,从而阻碍从业者自信地应用这种技术。作为回应,我们制定权重平均作为保留训练进度和提高扰动下的鲁棒性之间的权衡。我们进一步推导出一系列连续的平均内核,它统一了传统策略并实现了两个竞争目标之间的帕累托前沿。至关重要的是,开发了在 PTQ 下执行权重平均的理论框架。可以看出,较粗的量化更容易受到扰动,而较精细的量化可能受到的影响较小。因此,我们的结果可以为在不同 PTQ 条件下进行权重平均提供统一的理论指导。实验验证了预测的行为和提出的平均策略。代码可在 https://github.com/MOFA-LAB/weight-averaging-for-ptq. 获取

了解LLM训练中后训练量化的权重平均机制的原论文方法或结果图
图 2:MNIST 上两层 MLP 的说明性可视化。 (a) 具有不同数据顺序的 SGD 训练轨迹及其估计的潜在平均值。 (b) 与稳定的训练端点相比,权重平均减少了空间噪声,但引入了时间滞后。 (c) LNWA 描述了时间滞后和空间噪声之间的帕累托边界。颜色表示验证损失。