论文

CloneMem:面向AI分身的长期记忆基准评测

CloneMem: Benchmarking Long-Term Memory for AI Clones

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

AI分身旨在模拟个人的思想与行为,以支持长期、个性化的交互,这对记忆系统提出了严苛要求:需要随时间建模经历、情感与观点。现有记忆基准主要依赖用户与代理的对话历史,其在时间上碎片化,不足以刻画连续的生活轨迹。我们提出CloneMem,一个在非对话数字痕迹(包括日记、社交媒体帖子和电子邮件,跨度一至三年)基础上评测AI分身场景中长期记忆的基准。CloneMem采用分层数据构建框架以确保纵向一致性,并定义了评估代理追踪演化中个人状态能力的任务。实验表明,现有记忆机制在此设定下表现不佳,凸显了以真实生活为基础的个性化AI的开放挑战。代码与数据集发布于 https://github.com/AvatarMemory/CloneMemBench

CloneMem:面向AI分身的长期记忆基准评测
图2:Avatar Memory Benchmark 数据构建与评估流程总览。该流程从 persona、宏观层面的生命弧线与重大事件出发,经由中观层面带状态快照的阶段滚动生成,再到微观层面的详细事件模拟、证据抽取,并最终生成非对话式数字痕迹。抽取的证据随后被组织到按生命弧线划分的桶(arc-specific buckets)中,以支持基于证据的问答生成。Appendix A 中提供了该流程的详细版本。