论文
FinMCP-Bench:在模型上下文协议下评测LLM智能体真实世界金融工具使用的基准
FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol
摘要
本文提出FinMCP-Bench,一个通过调用金融模型上下文协议(MCP)工具来评估大语言模型(LLM)解决真实世界金融问题能力的新基准。FinMCP-Bench包含613个样本,覆盖10个主场景与33个子场景,兼具真实与合成的用户查询以保证多样性与真实性。它纳入65个真实金融MCP与三类样本——单工具、多工具与多轮——从而可跨不同任务复杂度层级评估模型。利用该基准,我们系统评估了一系列主流LLM,并提出了显式度量工具调用准确性与推理能力的指标。FinMCP-Bench为推进金融LLM智能体研究提供了一个标准化、实用且具挑战性的测试平台。
