论文
MemDelta:Agent记忆评测中的受控基线与隐藏混杂
MemDelta: Controlled Baselines and Hidden Confounds in Agent Memory Evaluation
摘要
Agent记忆相对RAG及全上下文的收益,常混入语言模型、嵌入器或检索流程变化。MemDelta在LongMemEval-S的500题、50余会话、三个模型家族中每次仅改变一个组件。四项结果为:逐字RAG与全上下文GPT-4o-mini分数47.2%和49.8%,差异不显著,p=0.34;不同模型排名反转,Gemini从全上下文获益14个百分点,Sonnet从RAG获益31个百分点,部分由于其拒答63%的全上下文查询。相同流程仅更换嵌入器即可提高6.2个百分点,n=500、p=0.004;Mem0比MiniLM-RAG高11个百分点,却比云RAG低1.2个百分点。Agent自主记忆的42%低于基础检索的47%。六种题型中的两种共88题,Mem0与云RAG效果相近,72.7%对73.9%、p=1.0,成本却为50倍,显示有限题型而非通用收益。论文建议比较时固定嵌入器、按模型家族分层,并报告写入流程成本。