论文

LiveMem:在长时间运行的 LLM 推理中保持内存状态连续性

LiveMem: Maintaining Memory State Continuity in Long-Running LLM Inference

摘要

长时间运行的助手和代理消耗的交互流最终超出了上下文的范围。现有的上下文保留、摘要和检索保留对选定历史记录的访问,但在工作上下文发生更改时,不会在整个生命周期内提供持久状态。我们将这种缺失的推理能力表述为 \emph{上下文转换下的状态连续性}:通过固定容量的内存状态进行计算,该状态的生命周期与活动上下文无关。我们引入了一种内在记忆方法 \textbf{LiveMem},它通过保留整个生命周期历史信息的记忆状态来增强预训练的全注意力 LLM,同时主注意力路径保留有界 KV 窗口。上下文周转和内存状态维护、面向内存的 后训练 和状态感知服务共同使该内存状态在其原始词元释放后承担负载。我们的实验表明,LiveMem 在评估的系统和其他内在内存方法中实现了领先的整体性能。 LongMemEval 的实验表明,即使支持证据已从当前上下文中删除,LiveMem 也能够根据记忆状态回答问题,并且证据距离分析表明有用信息仍然存在于活动窗口之外。因此,LiveMem 将状态连续性建立为连续 LLM 推理的独特且互补的抽象。