论文

纠正预处理语言模型优化器中的随机更新偏差

Correcting Stochastic Update Bias in Preconditioned Language Model Optimizers

模型训练预训练

摘要

预条件优化器是 模型训练 语言的核心,但它们的随机更新规则通常被视为群体预条件下降的直接近似。我们证明这种观点错过了两个有限样本偏差。首先,梯度和预处理器通常是从同一个小批量中估计的,引入了梯度-预处理器耦合偏差。其次,即使预处理器估计是无偏的,其逆或逆根通常也是有偏的,因为求逆是非线性的。我们提出了一个单批次偏差校正框架,可以解决这两种影响:交叉拟合预处理从独立的微批次组中估计分子和预处理器,而方差校正反演使用微批次变异性来减去领先的增量方法偏差项。该框架适用于对角矩、对角曲率和矩阵预处理方法,在 AdamW、Sophia 和 Shampoo 中实例化。偏差校正将 Qwen2.5-0.5B 上保留的预训练损失分别减少了 $0.15$、$0.07$ 和 $0.11$ nats;对混合质量预训练和下游指令调整的影响始终是中性到积极的。总之,这些结果将偏差校正确立为一种减少有限样本更新偏差并提高预处理优化器性能的实用机制。