论文

DynamicMCPBench:面向在线MCP服务器的轨迹落地效应评分基准

DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers

智能体系统智能体互操作协议Agent任务评测MCP长程任务评测

摘要

大语言模型(LLM)智能体日益部署于模型上下文协议(MCP)服务器之上,但用于评估它们的基准要么给最终答案打分,要么对照固定的“真值”工具列表——一旦底层数据在线且有状态,两者都脆弱。我们提出DynamicMCPBench,一个可复用框架而非固定数据集:从业者可在自己的MCP服务器上运行它、用自己的任务测模型,或让它自动收集服务器以测量模型解决智能体任务的一般能力。给定服务器与任意模型集合,它生成现实目标、在线 pursuit 每个目标以记录成功轨迹、把轨迹蒸馏为与路径无关的效应检查点,并按智能体是否复现那些效应打分——永不按最终答案打分。为展示该框架揭示什么,我们大规模运行:24个模型、121个服务器、750个任务均匀分布在15个任务类别(各50个),每类针对生成问题的一个独智能体具使用挑战。每个任务按pass^3计分:只有三次独立尝试全部成功才计为解决。即使最强的智能体也只解决约一半任务;31%的任务没有任何模型解决;且所需工具链越长准确率越崩(最短链39%到最长链13%)。人类验证研究确认自动评分可靠(机会校正一致0.76)。DynamicMCPBench把基准构建变成从业者可在自有服务器与模型上重跑的事,同时暴露当前智能体在长程多步任务上的一致性无能。

DynamicMCPBench:面向在线MCP服务器的轨迹落地效应评分基准:论文配图
图 1:DynamicMCPBench 管道。正向生成:目标种子代理探索实时 MCP 服务器,每个成功的执行跟踪都会被提炼成与路径无关的 TaskSpec:效果检查点、雷区和偏序。效果评分评估:候选智能体在确定性重放上运行,并且仅根据其是否使用任何效果等效工具重现这些效果进行评分,而不是根据其最终答案进行评分。定期刷新会重新运行参考并对偏差进行分类,从而保持基准测试的实时性。