论文

同策略 持续监督重播 微调

On-Policy Replay for Continual Supervised Fine-Tuning

模型训练持续学习

摘要

持续监督的 微调 (SFT) 是使 大语言模型 (LLM) 适应下游任务流的事实上的方法,但它遭受了对早期功能的灾难性遗忘。最近的研究表明,同策略 信号(对模型自身输出进行训练)比 离策略 监督更可靠地减少遗忘。现有的 同策略 方法通过新的训练目标路由该信号(例如,教师副本的自我 蒸馏 损失),继承了教师的额外前向传递、调度敏感性和风格漂移。我们改为通过训练数据源路由 同策略 信号。我们的方法 同策略 Replay (OPR) 在少量历史提示预算上推出最新的检查点,通过任务奖励过滤各代,并将幸存的(提示、模型响应)对作为普通 SFT 示例重放。没有老师,没有辅助损失,也没有即时蒸馏。在 TRACE 持续学习基准上的三个 7--8B 指令调整主干(Qwen2.5-7B-Instruct、Qwen3-8B、Llama3.1-8B-Instruct)中,OPR 持续减少遗忘;在最剧烈的压力测试(Qwen2.5-7B-Instruct、顺序 SFT BWT -13.93)中,OPR 在 10% 重播预算下将 BWT 提升至 -0.65,在 1% 预算下将 BWT 提升至 -2.29——|BWT| 减少了 46%在调整后的 Vanilla Replay 基线上,所有三个骨干网均观察到 42--46% 的减少。我们给出了 KL 收缩解释,将 OPR 和先前的 同策略 蒸馏 方法放在单轴上,并且我们提出了一个违反直觉的发现,解释了为什么 Vanilla Replay 已经成为强大的基线:低分重播均比 Vanilla Replay 更差,证明 OPR 中的活性成分是 同策略 分布,而不仅仅是响应质量。我们的代码可在https://github.com/Yancey2024/OnPolicyReplay。