论文
LifeBench:一个长程多来源记忆基准
LifeBench: A Benchmark for Long-Horizon Multi-Source Memory
摘要
长期记忆对能积累知识、推理用户经验并随时间适应的个性化智能体至关重要。然而,现有记忆基准主要针对陈述性记忆,即语义与情景类型,其中所有信息都在对话中显式给出。相比之下,现实行为还受非陈述性记忆支配,包括习惯性与程序性类型,需从多样数字痕迹中推断。为弥合这一差距,我们提出 Lifebench,其特色是稠密关联的长程事件仿真。它把 AI 智能体推向简单回忆之外,要求在多样且时间延展的情境中整合陈述性与非陈述性记忆推理。构建这样的基准有两大挑战:保证数据质量与可扩展性。我们采用匿名社会调查、地图 API 和整合节假日的日历等现实先验保证数据质量,从而在数据集中确保保真度、多样性与行为合理性。为提升可扩展性,我们借鉴认知科学,按部分学层级组织事件,实现高效并行生成并保持全局连贯。性能结果显示,顶级最先进记忆系统仅达 55.2% 准确率,凸显该基准中长程检索与多来源整合的固有难度。数据集与数据合成代码见 https://github.com/1754955896/LifeBench。
