论文

MCPAgentBench:评估 LLM Agent 使用 MCP 工具的真实任务基准

MCPAgentBench: A Real-world Task Benchmark for Evaluating LLM Agent MCP Tool Use

智能体系统智能体互操作协议Agent任务评测MCP

摘要

大语言模型(LLM)正越来越多地充当自主智能体,其通过模型上下文协议(MCP)使用外部工具被视为一种未来趋势。当前的 MCP 评测集存在依赖外部 MCP 服务、缺乏难度感知等问题。为解决这些局限,我们提出 MCPAgentBench,一个基于真实世界 MCP 定义、旨在评估智能体工具使用能力的基准。我们构建了一个包含真实任务与模拟 MCP 工具的数据集。评测采用动态沙箱环境,向智能体呈现包含干扰项的候选工具列表,从而测试其工具选择与辨别能力。此外,我们引入了全面的指标,同时衡量任务完成率与执行效率。在最新主流的 LLM 上开展的实验显示,各模型在处理复杂的多步工具调用方面存在显著性能差异。代码已公开。

MCPAgentBench:评估 LLM Agent 使用 MCP 工具的真实任务基准 配图
图3:TFS与TEFS的评测结果。