论文

EvoArena:跟踪动态环境中稳健的 LLM 代理的内存演变

EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments

模型评测基准与评测资源

摘要

大语言模型 (LLM) 代理在各种基准测试中都取得了出色的性能,但大多数评估都假设静态环境。相比之下,现实世界的部署本质上是动态的,要求代理不断调整其知识、技能和行为以适应不断变化的环境和更新的任务条件。为了解决这一差距,我们引入了 EvoArena,这是一个基准套件,它将环境变化建模为跨终端、软件和社交领域的渐进式更新序列。我们进一步提出了 EvoMem,一种基于补丁的记忆范式,它将记忆演化记录为结构化更新历史,使智能体能够通过记忆的变化来推理环境演化。实验表明,当前的智能体在 EvoArena 上表现不佳,在不断发展的终端、软件和社交偏好领域实现了 39.6% 的平均准确率。 EvoMem 不断提高性能,在 EvoArena 上平均提高 1.5%,并将 GAIA 和 LoCoMo 等标准基准提高 6.1% 和 4.8%。除了单个任务之外,EvoMem 在 EvoArena 上进一步将链级准确性提高了 3.7%,其中成功需要完成一系列相关的进化子任务的连续序列。机制分析表明,EvoMem 改善了记忆中的证据捕获,表明更好地保存了完整的演化环境状态。我们的结果强调了评估和记忆中建模演化对于可靠代理部署的重要性。