论文
超越静态对话:对现实、异质和不断进化的长期记忆进行基准测试
Beyond Static Dialogues: Benchmarking Realistic, Heterogeneous, and Evolving Long-Term Memory
摘要
在 大语言模型 (LLM) 的现有内存基准测试中,评估的对话会话通常缺乏长期语义一致性,并且底层角色往往是扁平和静态的。此外,在现实场景中,用户和助手之间的交互涉及更加多样化、异构的数据流,例如文档和电子邮件。这些缺点极大地限制了当前评估的现实性和有效性。为了解决这些限制,我们引入了 RHELM(现实、异构和进化的长期记忆)。在精心制作的用户配置文件和新颖的 LOOP (pLan-rOllout-evOlve-Prune) 模块的驱动下,我们在不同的交互场景中构建了真实的对话,展现出动态的时间演化和长期的一致性。至关重要的是,这些对话与与用户的时间事件轨迹同步的异构外部源深度集成。由此产生的基准包含跨越七种查询类型的具有挑战性的问题答案对,每个问题至少映射到 27 个关键记忆特征中的至少一个,我们认为这些特征是必要的,但在当前的研究中尚未得到充分探索。跨全上下文模型、检索增强生成(RAG)方法和代表性记忆框架的综合实验表明,当代方法仍然暴露出复杂的现实世界环境中的关键弱点,特别是在解决多源聚合和现实世界的上下文推理方面。