论文

大语言模型的时间增量持续预训练:知识更新而不会发生灾难性遗忘

Time-Incremental Continued Pretraining of LLMs: Knowledge Updates Without Catastrophic Forgetting

模型训练持续学习

摘要

大型语言模型 (LLM) 在预训练结束时就已经过时了,但从头开始重新训练的成本却高得令人望而却步。持续预训练(CPT)是自然的补救措施,但它通常是通过假设不相交数据流的持续学习镜头来评估的。这不太适合网络规模爬行的时间增量更新,其中连续快照在设计上共享大量 URL 重叠。我们在这种现实情况下研究时间增量 CPT:对严格从每个模型的知识截止后提取的 FineWeb-Edu 转储进行持续预训练,对跨越三个系列(OLMo2、Llama-3.1/3.2、Gemma-3-1B)和四个参数尺度(1B-3B-7B-8B)的六个开放权重模型进行评估。我们围绕四个实际问题整理我们的发现。 (i) 知识是否获得?是的,但是是异构的,并且没有灾难性的遗忘:六个模型中的五个也改进了截断前的事实回忆,并且增益跟踪预训练饱和度(主要由每个参数的词元预算驱动)。 (ii) 费用是多少?几乎没有:每个模型的 13 个任务套件的宏观平均值与基值的偏差都在 0.01 以内。 (三)配方是什么?数据质量主导数量(策划的 6B 词元切片与更广泛的 40B 词元切片相匹配);知识获取和一般能力的最佳值在学习率上大致相差一个数量级; LoRA 的排名足够匹配完整的 CPT。 (iv) 它能在部署后存活下来吗? CPT通过SFT获得转移,而DPO的效果则取决于家庭。总之,这些结果描绘了一幅比之前持续学习文献所暗示的更乐观的时间增量 CPT 画面。