论文

选择何时取代提取?使用类型化决策模型对Agent记忆进行预注册测试

When Does Selection Replace Extraction? A Pre-Registered Test of Agent Memory with a Typed Decision Model

上下文与知识模型推理判别式推理与决策记忆JevAgent记忆

摘要

会话记忆是否需要LLM提取的事实,或者选择正确的原始回合就足够了?公布的结果不同意。基于提取的系统报告从提炼事实中获得的收益。最近的研究发现排名良好的原始历史也能起到同样的作用,但对于排名是否重要存在分歧。我们对保留的 LoCoMo 对话和 LongMemEval 进行了一项预先注册的研究。在 LoCoMo 预算紧张的情况下,通过一次调用 Jev(一种类型化决策模型)选择的原始轮次并不逊色于 LLM 提取记忆(单边 95% 边界 -3.0 点,相对于 -5 点余量)。盲人评分会缩小差距,但不会改变结果。原始轮次的写入成本降低了 3,061 倍,并且结果与第二个答案模型相同。在这项研究中,重新排名的收益随着预算的增长而缩小。当保留 30 个候选者中的 3 个时,它在 LoCoMo 上增加了 17.4 分,在 LongMemEval 上增加了 9.1 分。如果预算充足,它会增加 1.5 和 1.1,并且提取系统更加准确。这说明了为什么公布的结果不一致。在匹配的上下文中,Jev 在三分之一的延迟下选择与 LLM 重新排名器(非劣效性界限 -2.0)一样准确,并且比多调用图遍历更准确。重新排名会降低正确的弃权率。计划、代码和评分答案均已发布。