论文

Off-策略合并击败 在策略自我蒸馏以实现持续学习

Off-Policy Merging Beats On-Policy Self-Distillation for Continual Learning

模型训练持续学习

摘要

人工智能的一个长期目标是建立一个能够不断学习和自我改进的模型。在训练后的模型上,新数据上的监督微调 (SFT) 通常会导致泛化能力差和灾难性遗忘。因此,传统观点认为 在策略训练是持续学习的先决条件。然而,在实践中,包含新知识或新能力的数据通常是不符合策略的。虽然 在策略自蒸馏 (OPSD) 等方法试图通过将 off-策略数据转换为 在策略信号来弥补这一差距,但它们已被证明会导致推理崩溃。在本文中,我们证明了在持续学习方面,off-策略合并击败了 OPSD。我们首先证明 SFT 从新数据中学习有用的信号,但天真地应用其更新会干扰现有功能。我们通过一个简单的方法来减少这种干扰,我们称之为嫁接,它改变了更新的学习位置和应用方式:(1)在早期的捐赠者检查点上学习更新,理想情况下甚至在预训练结束之前,并将权重更新应用于训练后的模型; (2)缩放权重更新,相当于模型合并的一种形式; (3)可选地,当新数据分布远离训练后模型时,屏蔽最敏感的更新方向。在持续学习环境中,包括(1)从专家痕迹中提取,(2)通过 STaR 和教学强化学习进行自我改进,以及(3)在预训练截止后注入知识,在新任务和旧任务性能中移植帕累托主导的 SFT 和 OPSD,同时避免昂贵的策略采样。因此,我们的工作对-策略训练提出挑战,认为这是持续学习 RL 训练模型的必要条件。