论文
任务向量下降:从非 IID 批次中学习
Task Vector Descent: Learning from Non-IID Batches
摘要
持续学习的一个核心挑战是获取新知识而不忘记模型已经学到的知识。当训练数据来自各种域、用户或特定于任务的分布时,随着时间的推移,这些分布会不均匀地出现,这种挑战就会出现在语言模型训练中。在这种设置中,连续的小批量按分布进行时间聚类,而不是进行独立同分布采样。从总体数据混合来看。时间聚类数据上的训练会导致稳定性与可塑性之间的权衡。使模型适应主动分布可以改进主动分布上的模型,但可能会导致之前训练的数据的性能下降。我们发现,随着暴露于同一分布的时间越长,这种权衡就会加剧。因此,我们询问这样一个序列(任务向量)产生的参数位移是否应该完全保留或部分应用。我们将应用完全位移 ($λ=1$) 与部分积分进行比较,部分积分在将任务向量应用于连续模型之前将任务向量缩放 $λ$,并按相同的系数缩放优化器状态。在连续预训练、随机初始化预训练、监督后训练和强化后训练中,我们发现 $λ$ 的中间值通常会相对于完全集成提高平均连续模型性能,特别是在较长的相同分布序列之后。在使用受控流和自然定义的适应序列的连续预训练实验中,任务向量缩放在匹配的学习速率下优于完全集成,这表明它的好处不能仅通过学习速率缩放来重现。