论文
清晰度感知预训练可减轻灾难性遗忘
Sharpness-Aware Pretraining Mitigates Catastrophic Forgetting
摘要
预训练优化器被调整为产生尽可能最强的基础模型,假设更强的起点在 后训练 和量化等后续更改之后会产生更强的模型。这忽略了基础模型的几何结构,它控制着基础模型的功能有多少能够在后续参数更新中幸存下来。我们研究了三种使优化偏向平坦最小值的预训练优化方法:锐度感知最小化(SAM)、大学习率和缩短学习率退火周期。在参数范围从 20M 到 150M 的模型大小中,我们发现这些干预措施在五个常见数据集上执行 后训练 后,持续提高了下游性能,遗忘率降低了 80%。这些原则在规模上成立:应用于现有 OLMo-2-1B 检查点的短 SAM 中期训练阶段在 MetaMath 后训练 后将遗忘减少了 31%,在 4 位量化后将遗忘减少了 40%。