论文

ComplexMCP:在动态、相互依赖且大规模的工具沙箱中评估LLM智能体

ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox

智能体系统智能体互操作协议Agent任务评测MCP

摘要

当前的LLM智能体擅长调用孤立的API,却在商业软件自动化的"最后一公里"上举步维艰。在真实场景中,工具并非独立:它们是原子的、相互依赖的,且容易受到环境噪声影响。我们提出ComplexMCP,一个旨在在这些严苛条件下评估智能体的基准。ComplexMCP构建于模型上下文协议(MCP)之上,提供逾300个经细致测试的工具,源自7个有状态沙箱,范围涵盖办公套件到金融系统。与现有数据集不同,我们的基准采用种子驱动架构来模拟动态环境状态与不可预测的API故障,确保评估既确定又多样。我们在全上下文与RAG两种范式下评估多种LLM,揭示了鲜明的性能差距:即使顶级模型也未能超过60%的成功率,远低于人类的90%。细粒度轨迹分析识别出三大根本瓶颈:(1)随动作空间扩大出现的工具检索饱和;(2)过度自信,智能体跳过关键的环境验证;(3)策略性失败主义,倾向于为失败找理由而非寻求恢复。这些发现凸显了当前智能体在相互依赖工作流上的不足,使ComplexMCP成为下一代韧性自主系统的关键试验台。

ComplexMCP:在动态、相互依赖且大规模的工具沙箱中评估LLM智能体:论文配图
图1:ComplexMCP总览:经种子驱动机制把有状态沙箱与无状态MCP服务器整合为评测环境。