论文

PATH-Bench:终身Agent的路径依赖评估

PATH-Bench: Path-Dependent Evaluation of Lifelong Agents

智能体系统上下文与知识记忆Agent任务评测Agent SkillsAgent记忆

摘要

终身LLM代理通过外部学习状态不断适应,这些状态存储了过去的交互作为可检索的记忆或可重复使用的技能。然而,现有的基准很少考虑经验累积路径如何影响代理所转移和保留的内容。在这项工作中,我们建立了PATH-Bench,这是一个针对路径依赖评估的终身代理基准。PATH-Bench通过多模型的上下文学习来估计有方向的任务关系,构建有控制的有益和干扰历史的探针中心序列,并重复评估探针任务以测量平均性能、向前转移、向后转移和遗忘。我们在正向和负向主导的历史下,评估了八种代表性代理在单回合代码生成和多回合工具使用任务上的表现。基准结果表明,经验的有用性取决于经验的表示方式和任务的交互结构,强转移并不保证保留,而且后期的经验可以重塑在学习路径中获得的收益。基于这些发现,我们提出了Selective Experience Use (SEU),这是一种代理捕捉器,它调节了路径累积的经验如何影响每个新的任务,允许有益项目,同时过滤潜在干扰。SEU在大多数设置中持续减少遗忘,同时在大多数情况下提高向前转移。PATH-Bench为设计更选择性和更稳健的终身代理提供了一个可控的评估框架和可操作的指导。

PATH-Bench:终身Agent的路径依赖评估:论文配图
图1:LifelongAgentBench(Zheng 等,2025a)中两条任务路径上的智能体排名变化。每个单元格展示从路径1到路径2在平均性能(AP)、前向迁移(FWT)、后向迁移(BWT)和遗忘(FGT)上的变化;颜色编码变化方向和幅度。