论文
几何冲突:LLM 连续 后训练 中遗忘的解释和控制
Geometry Conflict: Explaining and Controlling Forgetting in LLM Continual Post-Training
摘要
持续的 后训练 旨在用新的知识、技能和行为扩展 大语言模型 (LLM),但尚不清楚顺序更新何时能够实现能力转移以及何时导致灾难性遗忘。现有方法通过顺序 微调、重播、正则化或模型合并来减轻遗忘,但在确定合并新更新何时有益或有害时提供的标准有限。在这项工作中,我们通过三个问题来研究 LLM 连续 后训练:什么驱动遗忘?顺序获得的能力何时转移或干扰?如何使用兼容性来控制更新集成?我们通过任务几何来解决这些问题:我们通过参数更新来表示每个 后训练 任务,并研究更新引起的协方差几何。我们的中心发现是:遗忘可以被认为是状态相关的更新集成失败,当任务引起的协方差几何与演化模型状态的几何不匹配时,就会出现这种情况。当顺序更新与先前更新形成的模型状态保持兼容时,顺序更新就会传输,并且当状态相关的几何冲突变高时会发生干扰。受这一发现的启发,我们提出了几何冲突 Wasserstein 合并(GCWM),这是一种无数据更新集成方法,通过高斯 Wasserstein 重心构建共享 Wasserstein 度量,并使用几何冲突来控制几何感知校正。在 Qwen3 0.6B--14B 中,在域连续和功能连续设置上,GCWM 始终优于无数据基线,无需重放数据即可提高保留率和最终性能。这些结果将几何冲突识别为遗忘的解释信号和 LLM 连续 后训练 的实际控制信号。