论文
TF-Engram:用于 大语言模型 的具有 SSD 支持内存的免训练印迹
TF-Engram: A Train-Free Engram with SSD-Backed Memory for Large Language Models
摘要
大语言模型 (LLM) 将事实知识和特定领域的模式隐式存储在密集的 Transformer 参数中,通过预训练、微调、检索增强或更长的上下文使知识扩展成本高昂。印迹式内存提供了紧凑的隐藏状态注入路径,但现有的 GPU 驻留设计通常依赖于基于哈希的压缩,导致不相关的短语在共享槽中发生冲突,并削弱了短语级语义保真度。我们提出了 TF-Engram,这是一种无需训练的 Engram 系统,可以从外部语料库离线构建特定于短语的语义记忆,跨 GPU--DRAM--SSD 层次结构存储大型内存表,并使用提前退出引导预测预取来隐藏自回归解码期间的外部内存延迟。在 Qwen3-0.6B 上,TF-Engram 将平均下游得分从 57.6 提高到 59.4,优于冻结骨干网和参数匹配的 LoRA 基线。系统评估表明,可以以适度的离线成本构建大型 TF-Engram 表,SSD 支持的存储大大减少了 GPU 内存需求,预测预取可以恢复大部分由外部内存访问造成的吞吐量损失。这些结果表明,静态短语存储器可以作为可扩展、免训练且低开销的系统组件集成到 LLM 推理中。