论文
记忆移植:通过离线条件记忆扩展语言模型 预训练
Memory Grafting: Scaling Language Model Pre-training via Offline Conditional Memory
摘要
扩展条件内存提供了一种增加语言模型容量的有前途的方法,但现有的方法(例如 Engram)在 预训练 期间从头开始学习大型内存表,使得内存扩展成本高昂,有时甚至无效。我们提出了 Memory Grafting,这是一种条件内存扩展方法,它利用嫁接模型中的冻结隐藏状态作为条件 n-gram 内存。给定频繁的本地 n-gram,我们离线运行嫁接模型,将最终词元隐藏表示存储为内存值,并让接收模型通过精确的最长匹配后缀查找来检索它们。检索到的记忆通过轻量级投影和门进行调整,而基于散列的印迹回退保留了对不匹配上下文的覆盖。由于移植模型仅离线运行,并且精确查找相对于内存库大小的复杂性预计为 O(1),因此内存移植以有限的训练和推理开销扩展了外部潜在容量。在匹配的接收者架构和 预训练 预算下进行的实验表明,记忆移植比 MoE 和普通 Engram 基线都有所改进。在 2.8B 规模设置中,它将平均基准分数从 MoE 的 51.95 和 vanilla Engram 的 52.43 提高到 53.86。在 0.92B 尺度设置中,所有嫁接模型变体都比基线有所改善,其中 Qwen3.5-35B-A3B 的增益最强。这些结果表明,预训练模型可以作为外部潜在记忆的可重用构造函数,为扩展未来语言模型超越仅可训练参数提供了实际的一步。