论文

MCP 注册表中的随机抽取包含哪些内容,以及工具使用基准包含哪些内容

What a Random Draw from the MCP Registry Contains, and What Tool-Use Benchmarks Contain Instead

模型评测评测方法与指标

摘要

对模型上下文协议 (MCP) 服务器生态系统的研究以悄悄选择有效服务器的方式抽取样本:参考集、流行度列表、手工策划的框架或修复服务器直至其启动的管道。我们报告未修复的概率样本实际包含的内容。从 24,135 台服务器注册表普查中,我们抽取了 400 台带有已发布种子的 npm/stdio 服务器,并通过网络探测每台服务器。只有 48.8% 的人完成了初始化握手,而使用同一仪器测量的手工策划的框架则为 66.7%,而且主要的故障不是缺少凭据 (13.3%),而是服务器根本无法启动 (37.5%)。在运行的 195 个工具中,硬一致性是完全的:2,766 个广告工具中的致命 JSON 架构违规为零。可选的安全注释是真正的差异,随机抽取的工具级遗漏率为 58.8%,而策划框架的遗漏率为 41.5%,因此策划也使这个数字变得更美好。然后,我们使用一种保持不变的方法,将这些服务器宣传的工具描述与两个工具使用基准语料库进行比较。真实的 MCP 工具在余弦 0.70 处显示 2.8% 的接近重复,并且所有这些都位于单个服务器内:在每个测试阈值下,跨作者接近重复为 0.0%。 BFCL v4 显示 16.7%,其中 16.4 分位于独立呈现的任务之间。 UltraTool 显示 0.3%,比真实工具更干净,因此这是 BFCL 的属性,而不是合成语料库作为一类的属性。另外,68.8% 的原始 BFCL 行和 85.6% 的原始 UltraTool 行是精确的名称加描述重复,而真正的 MCP 为 0.4%,因此在没有全局重复数据删除的情况下对这些版本计算的任何统计数据都会衡量重复而不是工具。所有人物都从已发布的脚本和已发布的种子中重新生成。