论文
MCP-Persona:经环境仿真的真实个人应用上LLM智能体基准
MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation
摘要
模型上下文协议 (MCP) 已成为连接大型语言模型 (LLM) 与外部数据源和工具的变革性标准,并已在个人应用程序和开发平台中迅速采用。然而,现有的基准主要关注通用信息查找工具,未能捕捉个人社交应用程序带来的实际挑战,其中工具与个人帐户或本地数据库进行交互。为了弥补这一关键差距,我们推出了 MCP-Persona,这是第一个专门为评估代理在现实世界的个性化 MCP 工具上的表现而设计的基准。 MCP-Persona 包含一系列广泛使用的应用程序,从 Reddit 和小红书 (Rednote) 等社交媒体平台到 Lark (飞书) 和 Slack 等企业协作套件。我们对各种最先进 (SOTA) 代理进行的广泛实验证明了它们在个性化工具使用方面的巨大困难,从而凸显了基准在识别和解决这些限制方面的关键作用。 MCP-Persona 已公开发布于 https://github.com/wwh0411/MCP-Persona}{https://github.com/wwh0411/MCP-Persona。
