论文

MCP中的大语言模型行为举足轻重:度量由大语言模型造成的低效资源利用

LLM within MCP Matters: Measuring Inefficient Resource Utilization Driven by LLMs

模型评测智能体系统智能体互操作协议模型行为与机制分析MCP

摘要

模型上下文协议(MCP)标准化了服务器向大语言模型(LLM)暴露数据与工具的方式。一种常见的服务器设计将常用参考数据(如标识符查找表)直接嵌入服务器指令中,即服务器交给宿主应用的系统提示词文本。当查询涉及嵌入表中的条目时,模型可立即据此行动,而无需通过搜索工具重新发现相同信息。我们检验客户端大语言模型是否真的消费这类嵌入指令的数据,报告了在生产法律信息MCP服务器上针对24个大语言模型(9个Claude、6个Gemini、9个GPT)的54000次试验研究。一个移除竞争性搜索工具的诊断条件表明,失败主要由行为偏好而非能力缺失导致。搜索不可用时,24个模型中有23个能可靠读取嵌入数据(命中率至少98%);而搜索工具仅仅存在时,9个模型跌至15%以下。对三种指令级干预的2^3因子分析揭示强交互效应:三者组合可为24个模型中的20个恢复至少86%,但单独干预对特定模型家族可能适得其反。因此逐服务器的提示词工程只是权宜之计而非根治;我们主张MCP宿主应用应提供明确机制,使服务器指令在客户端大语言模型的决策中被置于工具选择之前。