论文

检索器也应记忆:面向长期智能体记忆的经验摊销重排

The Retriever Should Remember: Experience-Amortized Reranking for Long-Term Agent Memory

上下文与知识记忆Agent记忆

摘要

长期语言模型代理会在交互过程中积累记忆,但它们的检索器通常不积累检索经验。语义检索是高效的,但嵌入相似度并不总能反映某条记忆是否包含与当前查询相关的证据。大语言模型(LLM)重排器能提供更强的查询条件化相关性分数,但无状态的重排会在每次查询时反复为大量候选打分并在查询结束后丢弃这些分数。我们提出EARM,一个经验摊销重排框架,把先前获得的LLM相关性分数视为可复用的检索经验。EARM将稀疏的查询-记忆相关性分数存入在线矩阵,通过因果矩阵补全学习其共享结构,并将少量新观测分数与估计分数结合,对其余候选进行重排。随着经验积累,打分预算不断下降,使LLM重排从逐次查询的重复开销转变为代理一生中习得的检索能力。在长期对话记忆上的实验表明,观测与估计混合重排将答案准确率相较语义检索最多提升6.62%,且当只有17.5%的候选获得直接LLM相关性分数时仍然有效,从而大幅降低LLM重排的推理开销。这些结果促使我们以更宽的视角看待代理记忆:长寿命代理不仅要记住过去的内容,还应记住这些内容在检索中被证明有用的方式。

检索器也应记忆:面向长期智能体记忆的经验摊销重排:论文配图
图1:EARM 概览。语义检索为每个查询形成候选集;预算内的子集获得直接的 LLM 相关性评分;因果矩阵补全估计缺失的查询–记忆评分;混合重排在有直接评分时使用直接评分、否则使用补全评分来选择答案上下文。白色单元格表示对某查询可用但未被检索到的记忆。尽管实验在语义候选集内进行重排,同一补全模型也可以为有历史支撑的白色单元格评分,从而将搜索扩展到余弦检索之外。被选中的记忆在答案生成与评估之前恢复为时间顺序。