论文
为什么强化学习具有泛化能力? 大语言模型中后训练的特征级机制研究
Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models
摘要
基于强化学习(RL)的后训练通常可以提高大语言模型(LLM)超出训练领域的推理性能,而监督微调(SFT)经常导致一般能力遗忘。然而,这种对比背后的机制仍不清楚。为了弥补这一差距,我们提出了一种特征级机械分析方法,使用受控实验设置来探测 RL 泛化,其中 RL 和 SFT 调整模型是在相同数据上从相同的基础模型进行训练的。利用我们的可解释性框架,我们在共享特征空间内调整跨模型的内部激活,并分析特征在 后训练 期间如何演变。我们发现,SFT 快速引入了许多高度专业化的特征,这些特征在训练早期就稳定下来,而 RL 则引入了更多受限制且不断发展的特征变化,这些变化在很大程度上保留了基础模型的表示。着眼于强化学习成功但基本模型失败的样本,我们确定了一组紧凑的、与任务无关的特征,这些特征直接介导跨不同任务的泛化。特征级干预证实了它们的因果作用:禁用这些特征会显着降低 RL 模型的泛化性能,而放大它们则可以提高基础模型的性能。代码可在 https://github.com/danshi777/RL-generalization 获取。