论文
ComplexMCP:在动态、相互依赖且大规模的工具沙箱中评估LLM智能体
ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox
摘要
当前的LLM智能体擅长调用孤立的API,却在商业软件自动化的"最后一公里"上举步维艰。在真实场景中,工具并非独立:它们是原子的、相互依赖的,且容易受到环境噪声影响。我们提出ComplexMCP,一个旨在在这些严苛条件下评估智能体的基准。ComplexMCP构建于模型上下文协议(MCP)之上,提供逾300个经细致测试的工具,源自7个有状态沙箱,范围涵盖办公套件到金融系统。与现有数据集不同,我们的基准采用种子驱动架构来模拟动态环境状态与不可预测的API故障,确保评估既确定又多样。我们在全上下文与RAG两种范式下评估多种LLM,揭示了鲜明的性能差距:即使顶级模型也未能超过60%的成功率,远低于人类的90%。细粒度轨迹分析识别出三大根本瓶颈:(1)随动作空间扩大出现的工具检索饱和;(2)过度自信,智能体跳过关键的环境验证;(3)策略性失败主义,倾向于为失败找理由而非寻求恢复。这些发现凸显了当前智能体在相互依赖工作流上的不足,使ComplexMCP成为下一代韧性自主系统的关键试验台。
