论文

Fisher引导的持续预训练子模数据选择

Fisher-Guided Submodular Data Selection for Continual Pre-Training of Large Language Models

模型训练预训练

摘要

数据选择已是LLM训练的中心瓶颈:网络规模语料噪声大且token预算有限。在持续预训练(CPT)中它成为遗忘控制问题:选择不当的目标域语料会覆盖预训练检查点中编码的能力。现有CPT实践或用困惑度等参数无关标量为候选打分,或用大量额外通用域回放token缓解遗忘;两者都没有直接问"在候选上训练会把模型参数移向何处"。我们证明基于损失的选数会使CPT后的Fisher对角恰好在预训练模型已投入的高Fisher坐标上漂移下降,而低Fisher坐标基本不动——这种不对称暴露了灾难性遗忘的参数空间机制。受此启发,我们提出Fisher感知的CPT选择器:把每个候选的梯度分解为度量沿已投入参数方向扰动的锚定分量与度量无约束低Fisher子空间更新能力的前沿分量,用log行列式次模目标聚合两信号,并以可扩展流式数据选择管道单遍优化。在TinyLlama-1.1B与Llama-3.1-8B的医学CPT上,选择器改善目标域质量同时约束留出预训练基准的遗忘;更重要的是其token效率远超遗忘感知回放:1B选定token在适应与遗忘两端都超过用10B token训练的回放策略,获得10倍token效率优势。