论文

不平衡学习优化器的比较

On the Comparison of Optimizers for Imbalanced Learning

模型训练预训练

摘要

数据不平衡在机器学习中普遍存在,从罕见的单词和异常到异构或交叉表数据中代表性不足的模式。我们在连续时间下研究理想化优化器几何形状,以对深度学习中的小步训练进行建模。我们假设不平衡的根源是未被观察到的:优化器只能访问总的训练损失,而忽略了多数群体和少数群体的确切贡献。在这种情况下,我们描述了一个区域,无论可接受的少数结构如何,多数损失都会得到优化。我们推导出该区域的显式方程以及离开该区域所需时间的界限。与欧几里得梯度下降相比,这些界限对符号、谱和牛顿下降的少数振幅表现出更温和的依赖性。 AdamW 和 Muon 的实验表明,在语言、表格和图像任务中,与 SGD 相比具有类似的优势。