论文
MemoryCD:对 LLM 代理的长上下文用户内存进行基准测试,以实现终身跨域个性化
MemoryCD: Benchmarking Long-Context User Memory of LLM Agents for Lifelong Cross-Domain Personalization
摘要
大语言模型 (LLM) 的最新进展已将上下文窗口扩展到百万个词元的规模,但评估内存的基准仍然仅限于短会话合成对话。我们引入了 \textsc{MemoryCD},这是第一个大规模、以用户为中心的跨域内存基准测试,源自 Amazon Review 数据集中的终生真实行为。与依赖脚本角色生成合成用户数据的现有内存数据集不同,\textsc{MemoryCD} 跟踪跨年和多个域的真实用户交互。我们构建了一个多方面的长上下文记忆评估管道,由 14 个最先进的 LLM 基本模型组成,具有 6 个记忆方法基线,针对 12 个不同领域的 4 个不同的个性化任务,以评估代理在单域和跨域设置中模拟真实用户行为的能力。我们的分析表明,现有的记忆方法在各个领域都远未达到用户满意度,这为跨领域终身个性化评估提供了第一个测试平台。