论文

从回忆到遗忘:个性化Agent的长期记忆基准

From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents

模型评测基准与评测资源

摘要

与用户长期交互的个性化代理必须保持跨会话的持久记忆,并随着情况的变化进行更新。然而,现有的基准主要将长期记忆评估框架为从过去的对话中检索事实,对代理随着时间的推移巩固记忆或处理频繁的知识更新的能力提供的了解有限。我们推出了 Memora,这是一个长期记忆基准,涵盖数周到数月的用户对话。该基准评估三个基于记忆的任务:记忆、推理和推荐。为了确保数据质量,我们采用自动记忆依据核验和人工评估。我们进一步引入了遗忘感知记忆准确性(FAMA),这是一种在评估长期记忆时惩罚对过时或无效记忆的依赖的指标。对四个 LLM 和六个记忆代理的评估揭示了无效记忆的频繁重用以及协调不断变化的记忆的失败。记忆代理提供了有限改善,暴露了个性化代理长期记忆的缺点。