论文
基于小语言模型的轻量级LLM智能体记忆
Lightweight LLM Agent Memory with Small Language Models
摘要
尽管 LLM 智能体可以利用工具来完成复杂的任务,但它们仍然需要内存来保持交叉一致性并在长视野交互中积累可重用的信息。然而,基于检索的外部存储系统的在线开销较低,但由于有限的查询构造和候选过滤,准确性不稳定。相比之下,许多系统使用重复的大模型调用来进行在线内存操作,提高了准确性,但在长时间交互中积累了延迟。我们提出了 LightMem,这是一种轻量级内存系统,用于由小语言模型 (SLM) 驱动的更好的代理内存。 LightMem 将内存检索、写入和长期整合模块化,并将在线处理与离线整合分开,以实现有限计算下的高效内存调用。我们将记忆组织为用于即时会话上下文的短期记忆(STM)、用于可重用交互摘要的中期记忆(MTM)和用于巩固知识的长期记忆(LTM),并使用用户标识符来支持多用户设置中的独立检索和增量维护。在网上,LightMem 在固定检索预算下运行,并通过两阶段过程选择记忆:基于向量的粗略检索,然后进行语义一致性重新排序。离线时,它提取可重用的交互证据并逐步将其集成到 LTM 中。实验显示了跨模型规模的收益,LoCoMo 上的平均 F1 改进约为 2.5,更有效且中值延迟较低(83 毫秒检索;581 毫秒端到端)。
