论文
大规模内存解码器:预训练的参数化长期内存
Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory
摘要
仅解码器的语言模型将长期记忆和推理纠缠在单个参数集中,使得难以独立扩展记忆容量。 Memory Decoder 引入了参数化长期记忆模块,但仅在相对较小的规模上进行研究。在这项工作中,我们提出了大规模内存解码器,将内存模型扩展到 6.9B 参数,并在 300B 词元上对其进行预训练。在这种数据规模下,索引和搜索的综合成本使得标准 Faiss 管道不可行。我们通过用于 Faiss 索引和检索的分布式管道以及 kNN 分布的稀疏、批量加载来解决这个瓶颈。在模型尺度上,我们发现向内存分配更多参数比单独缩放基础模型能产生更好的参数性能权衡。在 17 个基准测试中,将 6.9B 通用内存与 Pythia-410M 搭配使用,其平均得分从 29.86 提高到 37.34,超过 Pythia-12B (37.24),总参数减少了 39%。对于从 0.6B 到 14B 的 Qwen3 Base 模型,1.7B 域存储器将三个域的平均得分在每个尺度上提高了 9 分以上。总的来说,我们的结果表明,独立扩展预训练内存为提高语言模型性能提供了一条参数更有效的途径。