论文

为什么自适应优化器会低估稀有词元

Why Adaptive Optimizers Underestimate Rare Tokens

模型评测模型行为与机制分析

摘要

在 softmax 输出层中,稀有标记在大多数步骤上接收较小的正 logit 梯度,而当它是目标时,在少数步骤上接收较大的负梯度。 SGD 只是将这些贡献相加。坐标自适应方法(例如 Adam、RMSProp 和符号下降)将每次更新除以其大小的运行估计,并且该估计在标记出现后立即达到最大。这种不平衡有两个影响。在整个输出层的层面上,我们描述了哪些优化器保留了平均输出嵌入:每个在过去的梯度中更新呈线性的方法都是如此,克罗内克分解和正交化方法(例如 Shampoo 和 Muon)也是如此。 Adam、Adafactor、Lion 和符号下降则不然,对于这些方法,我们获得了变化的精确逐步表达式。在单个稀有词元的级别上,相同的归一化会改变训练固定点。在一元模型中,符号下降会以恒定的预期速率降低不到一半小批量中出现的每个词元的logit。对于周期性到达的 RMSProp,我们可以用封闭形式求解固定点:如果至少两个连续小批量中不存在词元,则对于任何学习率,其平衡概率都严格低于该词元在数据中的出现频率,并且比率趋于 $κ/(2(e^{κ/2}-1))$。这里 $κ$ 是事件之间的平均步数除以二阶矩时间常数 $1/(1-β_2)$。在同一模型中,SGD 和 AMSGrad 保留无偏不动点。我们在一元模型和从已知生成分布训练的小语言模型中测试这些预测。对于随机到达,偏差比周期公式预测的要大;在语言模型中,具有偏置不动点的优化器也不太适合生成分布。