论文

基于零空间基 LoRA 的 RL 后 LLM 推理保持微调

Reasoning-Preserving Fine-Tuning of Post-RL LLMs with Null-Basis LoRA

模型训练参数高效训练

摘要

基于强化学习(RL)的后训练已成为激发大语言模型(LLM)推理能力的有效方法。然而,通过后续监督微调(SFT)把 RL 后模型适配到新知识领域或新行为时,可能严重覆盖这些能力。现有方法通过经验回放、专门初始化或基于梯度投影的约束优化来缓解此类遗忘,但要么保持效果有限,要么带来可观的训练开销。我们的分析表明,推理激活集中在低维子空间中,为适配留下了大量零空间容量,而相应的近似零空间可以用少量样本可靠估计。基于这些观察,我们提出 Null-Basis Low-Rank Adaptation(NB-LoRA),一种在适配 RL 后 LLM 的同时保持其已获推理能力的参数高效方法。我们把推理保持形式化为逐层隐状态保持约束,并从推理激活构造固定的近似零空间基,然后通过该基重参数化 LoRA 更新,在整个微调过程中强制执行保持约束。在多个 RL 训练的 LLM 和多样下游任务上的大量实验表明,NB-LoRA 在适配性能上与标准 LoRA 相当,推理准确率保持在接近微调前的水平,并将这种保持泛化到留出的推理基准上。

基于零空间基 LoRA 的 RL 后 LLM 推理保持微调:论文配图
图 2:Qwen2.5-3B 各代表层 H^T H 的归一化特征值谱,以对数刻度显示。