论文
CAGD:以条件锚定蒸馏稳定语言模型持续学习
Stabilizing language models under continual learning via condition-anchored distillation
摘要
语言模型的持续适应可以改变其在先前学习的提示上的输出分布,而保留每一个旧的提示-答案对可能是不可取的或不可能的。我们研究条件锚定生成蒸馏(CAGD):保留一小组旧提示,使用冻结的先前模型来重建完成和生成状态,并在学习下一个任务时匹配其预测分布。该公式将普通重放合并的三个角色分开:条件选择要保护的行为,教师模型 生成结果定位相关状态,软目标指定预测如何改变。对于自回归语言生成,教师模型-执行轨迹 蒸馏允许序列散度的精确链规则分解。对于掩蔽扩散语言建模,我们的实现直接控制 教师模型 生成的补全上的局部去噪漂移。在对 219M 掩蔽扩散语言模型的持续适应中,CAGD 将四任务最终 保留测试 损失在一个任务顺序中从 2.927 减少到 1.114,而反过来则从 2.168 减少到 0.891。当 教师模型 生成的支持保持相同时,相同的软目标比硬重放的最终平均损失降低了 0.055。 SMDM 和 Qwen3 的方向始终坚持新鲜的事实和自然的指示。在 GSM8K 上,Qwen 适应保留了答案格式合规性,但精确匹配保留在 0.6B 处进行了种子混合,并在 1.7B 处恶化。这些结果支持条件锚定功能保留作为测试语言生成目标的通用设计原则。