论文
灾难性遗忘的机制起源:为什么强化学习比 SFT 更好地保留电路?
Mechanistic origins of catastrophic forgetting: why RL preserves circuits better than SFT?
摘要
微调 大语言模型 (LLM) 经常会导致对先前功能的灾难性遗忘。最近的工作表明,强化学习(RL)比监督式 微调(SFT)更有效地保留了先验能力,这归因于策略梯度更新仍然更接近基本策略 \cite{shenfeld2025rl}。我们将这种行为解释扩展到机械层面,并询问强化学习的优势是否反映在内部计算电路的更强保留上。我们引入了差分电路脆弱性,这是一种在 微调 下衡量电路退化程度的头级测量方法,并用它来比较适用于科学问答的 Qwen2.5-3B-Instruct 上的 RL 和 SFT。我们发现了一个明显的机制权衡:SFT 可以更快地适应目标任务,但会产生更大的电路中断和对先前功能的遗忘,而 RL 则以较慢的任务适应为代价保留了大部分基本电路。这些发现表明,电路保留可能有助于解释为什么强化学习对于灾难性遗忘更加稳健。我们在这里发布了我们的代码:https://github.com/rl-sft- Circuit-research/ Differential-Circuit-vulnerability。