论文
理解语言模型的持续事实知识获取:从理论到算法
Towards Understanding Continual Factual Knowledge Acquisition of Language Models: From Theory to Algorithm
摘要
持续的 预训练 (CPT) 对于使语言模型 (LM) 能够集成新知识而不擦除旧知识至关重要。虽然数据重放等经典 CPT 技术已成为标准范式,但 LM 如何随着时间的推移获取和保留事实的机制(称为持续事实知识获取 (cFKA))仍不清楚。在这项工作中,我们提出了一个理论框架,该框架使用单层 Transformer 来表征 cFKA 的训练动态,为代表性 CPT 方法的行为提供了统一的解释。我们的分析表明,基于正则化的方法仅调整参数的收敛速度,而不改变固有的遗忘倾向,而数据重播方法成功地改变了收敛动态并稳定了预训练的知识。基于这些见解,我们提出了一种新颖的生成数据重播方法,称为 \textbf{S}electing \textbf{T}okens via attenti\textbf{O}n \textbf{C}ontribution~(STOC),它识别有影响力的事实片段来指导重播数据生成。对合成数据集和真实数据集的大量实验验证了我们的发现,并证明 STOC 通过减轻灾难性遗忘有效增强 cFKA。