论文
DynamicMCPBench:面向在线MCP服务器的轨迹落地效应评分基准
DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers
摘要
大语言模型(LLM)智能体日益部署于模型上下文协议(MCP)服务器之上,但用于评估它们的基准要么给最终答案打分,要么对照固定的“真值”工具列表——一旦底层数据在线且有状态,两者都脆弱。我们提出DynamicMCPBench,一个可复用框架而非固定数据集:从业者可在自己的MCP服务器上运行它、用自己的任务测模型,或让它自动收集服务器以测量模型解决智能体任务的一般能力。给定服务器与任意模型集合,它生成现实目标、在线 pursuit 每个目标以记录成功轨迹、把轨迹蒸馏为与路径无关的效应检查点,并按智能体是否复现那些效应打分——永不按最终答案打分。为展示该框架揭示什么,我们大规模运行:24个模型、121个服务器、750个任务均匀分布在15个任务类别(各50个),每类针对生成问题的一个独智能体具使用挑战。每个任务按pass^3计分:只有三次独立尝试全部成功才计为解决。即使最强的智能体也只解决约一半任务;31%的任务没有任何模型解决;且所需工具链越长准确率越崩(最短链39%到最长链13%)。人类验证研究确认自动评分可靠(机会校正一致0.76)。DynamicMCPBench把基准构建变成从业者可在自有服务器与模型上重跑的事,同时暴露当前智能体在长程多步任务上的一致性无能。
