论文

EvoAgentBench:经能力迁移的智能体自进化基准

EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer

智能体系统上下文与知识记忆Agent任务评测Agent记忆长程任务评测

摘要

长程LLM系统中的智能体自进化很大程度是程序性的:有用经验不只是存储信息,而是用于搜索、调试与验证的可复用流程。但当前评估未隔离这种迁移形式——智能体基准测单回合任务求解,记忆基准针对信息保持而非流程复用。我们引入EvoAgentBench:经能力引导迁移测试智能体自进化的基准,覆盖网页研究、算法推理、软件工程与知识工作四个领域。它从智能体执行中抽取以轨迹为据的能力、规范化为操作单元,并构建链接共享流程重叠任务的领域能力图;设计上每个测试任务都有经验证的训练侧能力支撑。在528/267训练测试划分、两个治控与三个骨干上:精选的能力内容跨模型家族可靠迁移,但没有当前自动方法能在所有设定保持正增益。EvoAgentBench把自进化评估从聚合准确率比较转向对经验编码、路由与吸收的细粒度诊断。基准公开于Hugging Face。

EvoAgentBench:经能力迁移的智能体自进化基准:论文配图
图 1:EvoAgentBench 构建流程。第一阶段:跨四个域的多个骨干网的无技能执行产生一个具有可重用跨度的跟踪池。第 2 阶段:通过嵌入阻止、LLM 裁决和专家评审,将原始能力卡合并到规范系列(方法、防护或工作流程)中。第三阶段:将任务-能力图划分为社区,并通过约束分割保证训练集侧对每个测试任务的能力支持。