论文

边缘语言模型的结构化内存:通过 O(1) SSM 状态注入进行持久上下文和语料库检索

Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection

上下文与知识检索增强

摘要

检索增强生成的预填充成本随检索上下文长度增加;使用Transformer骨干时,KV缓存还会随生成词元增长。状态空间模型(SSM)天然避免后一项成本,本文进一步将每次查询的预填充成本从O(L_context)降为O(1)。提出的PRECOG预计算上下文注入机制,利用SSM固定大小、不依赖位置的循环隐藏状态可概括已读内容的特点,离线将文档语料编码为隐藏状态,查询时直接注入最匹配的状态,完全绕过在上下文中重新输入文档。同一机制支持结构化记忆合并(SMC):按认知领域聚类的分层持久记忆,可调节保真度与存储开销,并以O(1)成本初始化会话。SMC将短期经历状态合并为长期语义记忆,查询时再与检索语料状态融合。在参数量为1.2B、隐藏状态为192KB的门控SSM语言模型TENNs-LLM上,PRECOG达到与上下文式RAG相当的回答质量,边缘硬件上的预填充延迟由约27秒降至6毫秒以内,约加速4500倍,使交互可用。该机制不能直接用于Transformer的KV缓存,因为后者与位置绑定,且随上下文长度线性增长。