论文

MCP-Persona:经环境仿真的真实个人应用上LLM智能体基准

MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation

智能体系统智能体互操作协议Agent任务评测MCP

摘要

模型上下文协议 (MCP) 已成为连接大型语言模型 (LLM) 与外部数据源和工具的变革性标准,并已在个人应用程序和开发平台中迅速采用。然而,现有的基准主要关注通用信息查找工具,未能捕捉个人社交应用程序带来的实际挑战,其中工具与个人帐户或本地数据库进行交互。为了弥补这一关键差距,我们推出了 MCP-Persona,这是第一个专门为评估代理在现实世界的个性化 MCP 工具上的表现而设计的基准。 MCP-Persona 包含一系列广泛使用的应用程序,从 Reddit 和小红书 (Rednote) 等社交媒体平台到 Lark (飞书) 和 Slack 等企业协作套件。我们对各种最先进 (SOTA) 代理进行的广泛实验证明了它们在个性化工具使用方面的巨大困难,从而凸显了基准在识别和解决这些限制方面的关键作用。 MCP-Persona 已公开发布于 https://github.com/wwh0411/MCP-Persona}{https://github.com/wwh0411/MCP-Persona。

MCP-Persona:经环境仿真的真实个人应用上LLM智能体基准:论文配图
图 1:MCP-Persona 的系统概述,它建立在工具、上下文和任务的交互之上。对于每个组件,我们引入了一种专用方法,详细描述为 Tool-Traverse (§3.1)、Context-Tree (§3.2) 和 Persona-Gen (§3.3)。