论文

可检索梯度:连续 后训练 无累积权重漂移

Retrievable Gradients: Continual Post-Training Without Cumulative Weight Drift

模型训练持续学习

摘要

持续的 后训练 使模型能够在部署后吸收新兴知识,但重复更新共享参数可能会累积权重漂移,可能导致灾难性遗忘并降低一般能力。检索增强生成避免了这种参数漂移,但通常缺乏参数知识集成的深度。在本文中,我们提出了 ReGrad(可检索梯度),这是一种将梯度视为可检索知识单位的新范式。 ReGrad 离线预先计算特定于文档的梯度,将它们存储在索引梯度库中,并在推理时仅检索与查询相关的梯度以进行临时权重调整。然而,原始语言建模梯度针对 词元级 文档重建进行了优化,而不是针对查询驱动的知识使用进行了优化。因此,我们引入了一个双层元学习目标,它将文档派生的梯度重塑为下游任务的可概括的适应信号。跨一般和特定领域设置的实验表明, \textsc{ReGrad} 优于 CPT 和 RAG 基线,从而实现可扩展和可逆的参数知识注入,而不会累积权重漂移。