论文

记忆作为马尔可夫矩阵:通过词元到字典映射进行样本有效知识扩展

Memory as a Markov Matrix: Sample Efficient Knowledge Expansion via Token-to-Dictionary Mapping

模型训练持续学习

摘要

不断融入新知识对于大语言模型(LLM)的长期发展至关重要。现有的方法通常依靠参数更新算法来减轻灾难性遗忘,但它们存在根本性的局限性:1)随着新注入的知识量的增长,遗忘是不可避免的; 2)模型更新通常是不可逆的。随着现代 LLM 的表现力越来越强,人们很自然地会质疑是否需要大规模的权重更新来获取少量的新知识。在这项工作中,我们提出了一个原则框架,将自回归语言生成建模为标记上的马尔可夫过程,其中模型记忆由马尔可夫转移矩阵表示。根据这个公式,合并新的知识/词元对应于扩展状态空间,并且保留现有的转换保证了先前学到的知识的保留。然后,我们通过词元到字典的映射策略证明了合并新词元的样本复杂度。特别是,为了学习每个新词元的转换行为,所需的样本数量与其映射到的现有词元的数量成线性比例。为了实现这种映射,我们提出了一种嵌入调整算法,该算法需要最少的参数更新并导致零遗忘。实验结果进一步证明了我们方法的有效性并验证了我们的理论发现。