论文

MINTEval:评估长视野代理系统中多目标干扰下的记忆

MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems

模型评测基准与评测资源

摘要

现实世界的智能体在长期且不断变化的视野中运行,信息不断更新,可能会干扰记忆,需要对多条信息进行准确回忆和聚合推理。然而,现有的基准侧重于静态、独立的回忆,无法捕捉不断变化的记忆之间的动态相互作用。在本文中,我们研究了当前的记忆增强代理如何在跨不同领域和问题类型的现实、干扰重、长视野的环境中表现。我们引入了 MINTEval(干扰评估下的长视野记忆),这是一个基准,具有以下特点:(1) 长的、高度互连的上下文,其中包含频繁更新的信息,会引起大量干扰;(2) 多样化的领域(状态跟踪、多轮对话、维基百科修订和 GitHub 提交),从而能够评估领域泛化;(3) 评估抗干扰鲁棒性的多样化问题类型,包括 (i) 需要从长上下文中检索特定目标的单目标回忆任务,以及(ii) 需要对多个相关信息进行推理的多目标聚合任务。总体而言,MINTEval 在长范围上下文中拥有 15,600 个问答对,平均有 138,800 个词元,每个实例最多有 180 万个词元。我们评估了 7 个代表性系统,包括普通长上下文 LLM、RAG 和内存增强代理框架。在所有系统中,我们观察到性能始终较低(平均准确率 27.9%),特别是在需要对多个证据进行聚合推理的问题上。我们的分析表明,性能主要受到检索和记忆构建的限制。此外,当前的记忆系统很难回忆和推理被后续上下文修改或干扰的早期事实,并且随着干预更新数量的增加,准确性会下降。