论文
RL忘记了!走向持续的政策优化
RL Forgets! Towards Continual Policy Optimization
摘要
持续的 后训练 正在成为使视觉语言模型适应不断发展的任务的中心范例。最近的研究报告称,强化学习比监督式 微调 更不容易遗忘,这引发了强化学习本质上具有抗遗忘能力的观点。然而,这种观点仍然没有得到充分验证,因为现有证据主要来自过时或同质的基准。我们通过引入 MRCL 来重新审视这一假设,MRCL 是一种根据最新的多样化多模态推理任务构建的多模态推理持续学习基准。 MRCL 上的实验表明,标准强化学习在持续的 后训练 过程中仍然会遭受灾难性遗忘。我们将失败归咎于客观的不匹配。常见策略优化方法中使用的 KL 正则化是在当前任务数据上进行评估的,而遗忘是由先验任务分布上的行为漂移引起的。为了解决这个问题,我们提出了持续策略优化(CPO),这是一种基于先验任务行为 KL 目标的免重放方法。 CPO 从历史 KL 目标导出局部 Fisher 代理,并使用参数移动作为 Fisher 灵敏度的无梯度代理,从而以可忽略的额外开销实现稀疏正则化。对三种模型规模的实验以及与多个 RL 基线的比较表明,CPO 持续减少遗忘,同时保持有效的适应并保留更广泛的预训练能力。实现代码可在 https://github.com/MaolinLuo/CPO 获取。