论文
何时复习:面向语言模型持续预训练的间隔重复
When to Review: Spaced Repetition for Continual Pre-Training of Language Models
摘要
大语言模型的持续预训练必须在获取新信息的同时不抹除旧知识。现有回放方法通常选择全局的新旧混合比例并均匀采样,忽略了样例在遗忘速度上的差异。我们将持续预训练表述为自适应复习调度问题:训练循环不仅应决定回放多少历史数据,还应决定哪些样例应在每一步重新出现。我们提出 Spaced Repetition Training(SRT),一个受认知科学启发的持续学习框架,使用 SuperMemo-2(SM-2)算法调度样例复演。SRT 维护逐样例复习状态,将逐样例困惑度映射为回忆质量信号,并调度历史样例用于保持、新样例用于巩固,同时保持模型、目标函数与优化器不变。在时间上分离的 Wikipedia 与代码语料上,SRT 改善了稳定性-可塑性权衡,在各模型规模上挽回朴素持续预训练所损失的 5 到 37 个百分点旧知识准确率,同时保持或提升新知识获取。在更大规模上,SRT 保住了朴素持续预训练与均匀回放会严重退化的广泛基准性能。在视觉与表格数据上的实验进一步表明,当配以合适的回忆信号时,这一调度原则可扩展到语言之外。