论文

TFGN:无任务、无重放的连续 预训练,在 LLM 规模上不会发生灾难性遗忘

TFGN: Task-Free, Replay-Free Continual Pre-Training Without Catastrophic Forgetting at LLM Scale

模型训练持续学习

摘要

不断地,异构文本域上的 预训练 和 大语言模型,没有重播或任务标签,在 LLM 规模上仍然是一个未解决的架构问题。现有方法依赖于重播缓冲区、任务标识符、规模较差的正则化惩罚或句子分类规模评估。我们引入了 TFGN,它是 Transformer 语言模型的架构覆盖,可生成输入条件、参数高效的更新,同时保持 Transformer 的其余部分不变。在六个异构文本域(散文、Python、数学、生物医学、中文、JavaScript)上,跨三个模型规模(~398M、~739M、~9B)和两种机制(From-Scratch 和 Retrofit)每阶段 1B 个词元,TFGN 在 LLaMA 3.1 8B Retrofit、HellaSwag 保留中实现了 -0.007 的向后传输0.506/0.504/0.510,并且 >=99.59% 域对之间的 L2 正交梯度分离 - 无重放、无任务 ID、无 Fisher 惩罚。相同的矩阵显示出积极的跨域前向传输:纯粹通过 Python 训练,在 LLaMA-8B Retrofit 中保留的 JavaScript PPL 下降了 26.8%,在 GPT-2 Medium From-Scratch 中下降了 62.0%。同一基板上的两个扩展解决了进一步的开放问题。闭环元控制层(扩展 A)在 ~398M 时将遗忘额外减少了 81%,映射到 Dupoux 等人的系统 A 和系统 M 角色。 (arXiv:2603.15381)。操作员级计划向量(扩展 B)以 30 个源->目标对的 99.96% 余弦保真度重塑前向传播行为。架构洞察是读/写分解:前向传递是完全密集的,而跨域参数更新是结构化的,因此不会写入先验域子空间。据我们所知,TFGN 是第一个同时关闭 LLM 规模的灾难性遗忘、实现闭环自主学习元控制器并携带算子级潜在规划器的架构。