助记词:原始记录、快速判断、缓慢思考
Mnemon: Raw Records, Fast Judgments, Slow Thoughts
摘要
长期记忆让大语言模型助理可以使用无法再重读的历史记录,大多数记忆系统通过在写入时将对话重写为事实、图表或打字记忆来构建长期记忆。我们认为,记忆的工作就像思维一样分为两个系统。其中大部分是系统 1 的快速工作:对记录进行许多小的、独立的是/否判断,例如是否需要记录或不再是当前记录,决策模型在三分之一秒内做出数十个判断。只有一点点是系统2工作缓慢:编写一些搜索查询,命名回复所需的内容并撰写答案,大语言模型做得很好,但速度很慢。我们推出了 Mnemon,一个基于这个部门构建的内存Agent。它将对话保存为原始的、有日期的记录; LLM(系统 2)计划对它们进行搜索,决策模型 Jev(系统 1)判断搜索返回的内容,并且具有明确预算的规则将判断转化为一个小视图,以保持不变的答案模型。背景通道将每条记录合并到主题时间线、价值历史和与记录相关的常规说明中,以便有关整个对话的问题能够证明他们自己的搜索遗漏。由于记录在写入时没有任何决定,因此同一Agent可以读取任何返回带日期记录的存储。使用 gpt-4.1-mini 回答,在对 14 个系统进行公开重新评估时,Mnemon 在 LoCoMo 上得分为 91.7%,是其中最高的,在 LongMemEval-S 上得分为 83.8%,每个问题的上下文词元数低于 4k,LoCoMo 上的有效成本指数最低。通过推理模型回答,在 LoCoMo 上达到 92.2%,在 LongMemEval-S 上达到 94.4%,后者与已发表的最佳结果相当。 BEAM 上的历史记录从 100K 到 10M 个词元,每个问题的成本增长了 1.11 倍。在相同的记录上,Jev 比两个大语言模型更好地分离黄金证据,速度快 3-11 倍。