论文
MoNe:面向高效长上下文推理的模块化神经记忆
MoNe: Modular Neural Memory for Efficient Long Context Inference
摘要
我们提出 MoNe,一个轻量的模块化神经记忆,可附加到任何冻结的预训练 Transformer 上,在无需再训练的情况下实现长上下文推理。MoNe 以层局部化梯度更新对快速权重神经记忆网络做测试时学习,按固定大小分段读取上下文;在推理时,记忆仅凭查询 token 生成键与值,无需重新读取上下文 token。这一两阶段设计将推理成本与上下文长度解耦,实现 O(N) 预处理与 O(1) 查询成本,且峰值 GPU 显存不随 N 增长。在 128K token 下,与 ICL 相比,MoNe 将计算量与峰值 GPU 显存均降低约 80%,仅增加 6.4% 参数开销。MoNe 可泛化到远超骨干原生窗口的上下文长度,在 RULER 的 needle-in-a-haystack 与单词提取基准上,ICL 急剧退化之处 MoNe 仍取得强劲表现。
