论文
MCPEvol-Bench:跨MCP服务器动态演化的LLM智能体表现基准
MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers
摘要
随着模型上下文协议(MCP)服务器成为连接LLM与外部工具的核心基础设施,既有基准利用真实MCP服务器评估LLM智能体的工具使用能力。但这些基准忽略MCP服务器内工具接口与功能的持续演化——产生有缺陷的评估,无法捕捉智能体在变化工具环境中的适应性。为弥合差距,我们提出MCPEvol-Bench:一个评估LLM智能体在动态工具集演化下任务解决能力的新基准。受大规模实证研究启发,我们提出11个变异算子,在123个MCP服务器内仿真现实的工具演化。我们在MCP服务器的多个版本上基准测试12个最先进LLM:揭示即使前沿模型也难以适应演化的工具——例如GPT-5.4与Claude-Sonnet-4-6在演化MCP服务器上分别出现13.7%与14.4%的表现下滑,伴随规划与推理错误的大幅增加。发现凸显LLM驱动工作流的脆弱性,确立MCPEvol-Bench作为动态工具环境中智能体适应性的评估标准。
