论文
EvoAgentBench:经能力迁移的智能体自进化基准
EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer
摘要
长程LLM系统中的智能体自进化很大程度是程序性的:有用经验不只是存储信息,而是用于搜索、调试与验证的可复用流程。但当前评估未隔离这种迁移形式——智能体基准测单回合任务求解,记忆基准针对信息保持而非流程复用。我们引入EvoAgentBench:经能力引导迁移测试智能体自进化的基准,覆盖网页研究、算法推理、软件工程与知识工作四个领域。它从智能体执行中抽取以轨迹为据的能力、规范化为操作单元,并构建链接共享流程重叠任务的领域能力图;设计上每个测试任务都有经验证的训练侧能力支撑。在528/267训练测试划分、两个治控与三个骨干上:精选的能力内容跨模型家族可靠迁移,但没有当前自动方法能在所有设定保持正增益。EvoAgentBench把自进化评估从聚合准确率比较转向对经验编码、路由与吸收的细粒度诊断。基准公开于Hugging Face。
