论文

DynamicMem:贴近真实使用条件的长周期Agent记忆基准

DynamicMem: A Long-Horizon Memory Benchmark in Real-World Settings

模型评测基准与评测资源

摘要

作为个人助手的LLM Agent需要跨月记住用户属性、习惯和偏好,并随工作、日常活动和喜好变化更新。现有记忆基准的简短交互没有覆盖三项真实行为特征:不同信息以不同时间尺度变化;变化受季节、生活事件等外部背景影响;信息很少明确给出,而散落在不同应用的活动中,需要记忆系统推断。DynamicMem为每名用户合成15个月活动,提供因隐私限制难以获取的长期跨应用数据。16个应用覆盖电商、健身和社交等,每名用户平均220万词元、1772个有具体依据的事件,画像从不直接提供。评测在五个季度检查点追踪历史增长的影响。五种代表系统显示:画像重建随历史增长退化,服务任务准确率却持平,尽管两者使用同一记忆;没有系统同时妥善保留仍有效事实并替换已改变事实,错误集中于偏好和精确指代;超过93%的失败源于记忆检索,而非模型生成答案,因此主要改进空间在记忆系统。代码:https://wenyaxie023.github.io/DynamicMem/。