论文

CALMem:用于对话式人工智能的应用层双记忆

CALMem : Application-Layer Dual Memory for Conversational AI

上下文与知识记忆Agent记忆

摘要

大语言模型 (LLM) 在固定上下文窗口内运行,从根本上限制了对话的连续性。当上下文填满时,压缩会不可逆地丢弃历史记录;当会话结束时,所有内存都会重置为零。现有的解决方案——更大的上下文窗口、知识库的检索增强生成以及 MemGPT 等内存增强架构——要么需要模型修改,要么强制提供者锁定,要么无法解决压缩连续性问题。我们提出了 CALMem(会话应用层内存),这是一种应用层双记忆架构,可为基于 LLM 的会话助手提供几乎无限的有效上下文,而无需对底层模型进行任何修改。 CALMem 结合了两个互补的记忆子系统:一个基于会话历史滑动窗口向量嵌入的情景记忆层,以及一个代理可写结构化事实的语义记忆层。词元预算自适应注入机制,称为 MOIM(注入内存消息),每轮自动检索并注入相关的过去上下文,与上下文压力成反比地缩放注入深度。一个关键的贡献是会话内检索:当前会话中压缩的轮流仍然可搜索,从而弥补了先前工作未解决的空白。该系统在生产 Rust 代码库中作为纯应用程序层实现,与提供者无关,并且在禁用时降级为原始 LLM 行为,开销为零。我们描述了架构、设计决策和性能特征,并分析了指导每个实施选择的权衡。