论文

$\delta$-mem:大语言模型的高效在线内存

$\delta$-mem: Efficient Online Memory for Large Language Models

模型架构Transformer

摘要

在长期助手与智能体系统中,大语言模型日益需要积累并复用历史信息。单纯扩展上下文窗口成本高昂,且往往无法保证有效的上下文利用。我们提出$δ$-mem,一种轻量记忆机制:以紧凑的在线联想记忆状态增强冻结的全注意力主干。$δ$-mem将过去信息压缩为固定尺寸的状态矩阵,通过delta规则学习更新,并利用其读出在生成过程中对主干的注意力计算生成低秩修正。仅凭$8\times8$的在线记忆状态,$δ$-mem便将平均分数提升至冻结主干的$1.10\times$、最强非$δ$-mem记忆基线的$1.15\times$。它在重记忆基准上增益更大:MemoryAgentBench上达到$1.31\times$、LoCoMo上达到$1.20\times$,同时大体保留通用能力。这些结果表明,有效的记忆可以通过与注意力计算直接耦合的紧凑在线状态来实现,无需全量微调、更换主干或显式扩展上下文。

δ-mem:面向大语言模型的高效在线记忆:论文配图
图 1:δ​-mem\delta\text{-mem} 的概述。给定来自冻结 Transformer 主干的隐藏状态,δ​-mem\delta\text{-mem} 首先将其投影到低维记忆空间中,并从先前的在线状态中读取上下文相关的关联记忆信号,并使用该信号生成对注意力计算的低秩校正。计算完成后,通过增量规则学习用当前的键值信息更新内存状态。