论文

MCPEvol-Bench:跨MCP服务器动态演化的LLM智能体表现基准

MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers

智能体系统智能体互操作协议Agent任务评测MCP

摘要

随着模型上下文协议(MCP)服务器成为连接LLM与外部工具的核心基础设施,既有基准利用真实MCP服务器评估LLM智能体的工具使用能力。但这些基准忽略MCP服务器内工具接口与功能的持续演化——产生有缺陷的评估,无法捕捉智能体在变化工具环境中的适应性。为弥合差距,我们提出MCPEvol-Bench:一个评估LLM智能体在动态工具集演化下任务解决能力的新基准。受大规模实证研究启发,我们提出11个变异算子,在123个MCP服务器内仿真现实的工具演化。我们在MCP服务器的多个版本上基准测试12个最先进LLM:揭示即使前沿模型也难以适应演化的工具——例如GPT-5.4与Claude-Sonnet-4-6在演化MCP服务器上分别出现13.7%与14.4%的表现下滑,伴随规划与推理错误的大幅增加。发现凸显LLM驱动工作流的脆弱性,确立MCPEvol-Bench作为动态工具环境中智能体适应性的评估标准。

MCPEvol-Bench:跨MCP服务器动态演化的LLM智能体表现基准:论文配图
图 1:MCPEvol-Bench 的框架。 (A) MCP 服务器演化的实证研究:验证演化的普遍性并确定主要的演化模式。 (B) LLM 驱动的 MCP 服务器演进:模拟开发人员行为,自适应地选择变异算子进行源代码修改,生成演进的工具集。 (C) MCP 代理演进评估:评估跨多个版本的 MCP 服务器的 LLM 代理的任务性能。