论文
MemRetriever:学习从长期记忆中搜索、反思和检索
MemRetriever: Learning to Search, Reflect, and Retrieve from Long-Term Memory
摘要
长期记忆可以实现个性化代理,但其价值取决于在正确的时间检索正确的证据。大多数内存系统使用静态 top-k 检索:它们发出一个查询,返回固定数量的内存,并将它们直接传递到下游模型。这种方法可能会错过跨会话分布的证据、引入不相关的内容并浪费上下文,特别是对于多跳、时间和知识更新问题。我们提出了 MemRetriever,一种代理检索模型,它将内存访问视为多步骤搜索过程。在每一步中,MemRetriever 都会对当前证据进行推理,并选择并行搜索来进行广泛探索,选择串行搜索来完成目标,或者选择反射和去噪来进行过滤和证据评估。当保留的证据足以供下游回答时,它就会停止。我们构建了用于监督热启动训练的 ReAct 式搜索记忆轨迹,并通过组相对策略优化进一步优化模型。奖励设计鼓励证据覆盖、减少噪音、答案充分性和有效终止。 LOCOMO、LongMemEval、HotpotQA、MuSiQue 和 2WikiMultiHopQA 上的实验表明,相对于静态检索和仅受监督的基线,取得了一致的改进。 MemRetriever-4B-RL 在相同管道下的主要 LongMemEval 检索指标上也优于 DeepSeek-v4-Flash,并且在 MuSiQue 上的比较方法中取得了最强的结果。由于其决策逻辑独立于存储后端,MemRetriever 还可以对外部知识库和向量数据库进行操作。这些结果表明,计划、搜索、过滤证据并确定何时停止的中间决策层可以改善长期记忆检索和知识密集型问题回答。