论文

脚手架比接口更重要:跨七种Agent脚手架、五个语言模型与一个软件任务的MCP与CLI工具调用受控比较

The Scaffolding Matters More Than the Interface: A Controlled Comparison of MCP and CLI Tool Use Across Seven Agent Scaffoldings, Five Language Models, and One Software Task

智能体系统Agent Harness智能体互操作协议Agent任务评测MCP

摘要

AI编码智能体的运行成本,更多取决于驱动它的Agent脚手架,而不是它访问工具所经的接口。我们着手测量经由模型上下文协议(MCP)的工具调用与经由普通命令行界面(CLI)的工具调用之间的成本差,已发表估计对这一差异的判断相差超过一个数量级,且都基于不可复现的从业者报告。我们在七种Agent脚手架和五个语言模型上运行同一个固定软件任务——对一个私有在线git仓库的六项操作——并通过检查仓库状态而非信任智能体自报来验证完成情况。主导因素是脚手架。七个脚手架中有两个完全不提供MCP支持;它们仅用CLI完成了每一次运行,说明MCP对这类工作并非必要,而且在仅比较CLI运行、任何地方都不挂载MCP服务器的情况下,它们比支持MCP的五个脚手架便宜5.0到28倍。该效应在本地运行的270亿参数小模型上最大,其成本在不同脚手架间相差139倍,而它在所有脚手架下都完成了任务。我们原本想做的比较被证明并不稳定:十三个严格配对的MCP对CLI成本比在0.43倍到29倍之间,两侧都有离群值。两种接口在失败成本上有区别:MCP运行花费的12.9%没有换来完成的工作,而CLI运行为2.2%;但在失败频率上没有区别:无论原始运行还是重复运行,两者的失败率相当。智能体经常无视被分配的接口,因此不核验实际行为的比较测量的只是未知混合物。测试框架、任务、验证与完整数据集均以开源发布。