更少的上下文,更高的准确性:LLM 代理的双时态内存引擎,精益检索的上下文胜过完整的历史记录
Less Context, More Accuracy: A Bi-Temporal Memory Engine for LLM Agents Where a Lean Retrieved Context Beats the Full History
摘要
长期记忆是 LLM 代理缺失的一层:他们会忘记整个会话,而常见的解决方法(将整个历史记录重播到提示中)成本高昂、速度缓慢,而且随着干扰因素的积累,准确性也会降低。大多数内存系统在成本或延迟方面获胜,但在准确性方面仍然输给了全上下文基准,并且基准数据是在不一致、不可重现的工具上报告的,因此一个系统在不同来源上的得分截然不同。我们推出了 Engram,这是一种基于双时态数据模型的开源双进程内存引擎。快速写入路径附加无损片段,且关键路径上没有 LLM;异步路径提取原子(主语、谓词、宾语)事实,构建双时态知识图,并解决矛盾,而无需每个事实调用 LLM - 无效,永不删除,因此每个事实都保留出处和取代链。混合读取路径融合密集、词汇、图形和新近度/显着性信号,应用时间点(“as-of”)过滤器,并组装紧凑的、带有出处标记的上下文。在由官方特定类别法官评分的完整 500 个问题 LongMemEval_S 中,Engram 的精益配置(从约 9.6k 词元检索切片中回答,而不是完整历史记录)在约 8 倍的词元(9.6k 与 79k)下,全上下文得分为 83.6% 与 73.2%(+10.4 分,McNemar p < 10^-6), 0/500 错误。增益需要混合读取路径:单独的事实会失去记忆,而事实加上检索到的块会恢复细节。我们还贡献了一个中立的回购评估工具,其中包含官方法官和每个表中的完整上下文基线,发布每个问题的原始日志,并记录悄悄扭曲内存基准的测量完整性陷阱(截断、本土法官、完整历史泄漏)。每个数字都附带一个重现它的命令。