论文

LLM 强化学习中保持可塑性的 KL 正则化以保持能力

Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning

模型训练强化学习

摘要

强化学习 (RL) 已成为 大语言模型 (LLM) 后训练 的核心范例,但针对新目标的优化可能会降低基本模型中已有的功能。 KL 正则化被广泛用于通过限制政策向参考模型的漂移来减轻这种遗忘。然而,标准的全策略 KL 正则化限制了整个响应分布,并且可能不必要地限制探索和目标任务学习。这就提出了一个自然的问题:更精确的约束能否保留现有能力,同时最大限度地减少对学习新任务的干扰?为此,我们提出 \underline{Co}rrectness-Conditioned \underline{KL} 正则化(CoKL),这是一种条件正则化框架,它将保留约束从完整输出分布缩小到正确性条件响应分布。我们用前向 KL 散度实例化 CoKL,并为基于 RL 的 LLM 后训练 导出实用的有限组训练目标。在群体层面,CoKL 将分配给正确响应的总概率与其正确性条件分布解耦,从而规范参考支持的正确响应之间的相对概率分配,而无需直接锚定不正确的输出或总正确性质量。我们进一步表明,当参考策略不完善时,全策略正向和反向 KL 正则化会导致严格的最优正确性差距,而 CoKL 则避免了这种限制。在受控多解环境和跨多个模型尺度的连续 后训练 设置中进行的实验表明,与现有的正则化方法相比,CoKL 在目标任务改进和先验能力保留之间实现了更有利的平衡。我们的代码可在 https://github.com/Lumina04/CoKL 获取。