论文

诊断 LLM 智能体记忆中的检索与利用瓶颈

Diagnosing Retrieval vs. Utilization Bottlenecks in LLM Agent Memory

模型评测上下文与知识记忆评测方法与指标Agent记忆

摘要

记忆增强的 LLM 智能体会存储并检索先前交互的信息,但记忆的写入方式与检索方式孰更关键仍不清楚。我们提出一个诊断框架,分析性能差异如何在写入策略、检索方法和记忆利用行为间显现,并将其应用于 3x3 研究:三种写入策略(原始分块、Mem0 式事实抽取、MemGPT 式摘要)与三种检索方法(cosine、BM25、混合重排)交叉。在 LoCoMo 上,检索方法是主导因素:不同检索方法的平均准确率相差 20 个百分点(57.1% 到 77.2%),而写入策略间仅差 3-8 个百分点。零 LLM 调用的原始分块存储与昂贵且有损的替代方案相当甚至更优,表明当前记忆流水线可能丢弃了下游检索机制无法补偿的有用上下文。失败分析显示性能崩溃最常出现在检索阶段而非利用阶段。我们主张,在当前检索实践下,改进检索质量比提高写入时的复杂度收益更大。代码已在 https://github.com/boqiny/memory-probe 公开。

诊断 LLM 智能体记忆中的检索与利用瓶颈
图1:在检索到生成的边界处设有三个诊断探针的记忆–智能体流水线。