论文
通过强化克服视觉持续学习中的灾难性遗忘 微调
Overcoming Catastrophic Forgetting in Visual Continual Learning with Reinforcement Fine-Tuning
摘要
最近的研究表明,强化 微调 (RFT) 本质上比监督 微调 (SFT) 更能抵抗灾难性遗忘。然而,RFT(例如 GRPO)能否在具有挑战性的视觉连续学习环境(例如类增量学习(CIL)和领域增量学习(DIL))中有效克服遗忘仍然是一个悬而未决的问题。通过一项试点研究,我们确认,虽然 RFT 始终优于 SFT,但它仍然存在不可忽视的遗忘问题。我们凭经验将这一瓶颈追溯到轨迹级漂移不可知论:在实现相同任务奖励的候选部署中,与前一任务策略的 KL 偏差差异很大,这与顺序任务中的灾难性遗忘密切相关。受这一见解的启发,我们提出了保留感知策略优化(RaPO),这是一种简单而有效的 RFT 方法,可以通过轨迹级奖励塑造来明确减轻遗忘。具体来说,RaPO 包含两个核心组成部分:(1)保留奖励,将轨迹级分布漂移转换为连续奖励信号,优先加强每个组内的知识保留部署; (2)跨任务优势归一化(CTAN),跨任务边界维持奖励统计的持续指数移动平均值,以稳定持续学习过程中的优化进度。利用 MLLM 的自由形式文本泛化,我们在五种视觉持续学习设置中全面评估 RaPO。大量实验表明,RaPO 实现了领先的性能,在保持强大的可塑性的同时,大幅减少了灾难性遗忘。据我们所知,这项工作代表了 RFT 在视觉持续学习中的首次系统探索,提供了我们希望能够激发未来研究的见解。