论文
MedMCP-Calc:经MCP集成在真实医疗计算器场景下评测LLM
MedMCP-Calc: Benchmarking LLMs for Realistic Medical Calculator Scenarios via MCP Integration
摘要
医疗计算器是定量、循证临床实践的基础。然而,其真实使用是一个自适应的多阶段过程,需要主动获取EHR数据、依场景选择计算器并进行多步计算,而当前基准只关注带显式指令的静态单步计算。为弥补这些不足,我们提出MedMCP-Calc,首个经模型上下文协议(MCP)集成评估LLM在真实医疗计算器场景表现的基准。MedMCP-Calc包含跨4个临床领域的118个场景任务,具有模仿自然查询的模糊任务描述、结构化EHR数据库交互、外部参考文献检索与过程级评估。我们对23个领先模型的评估揭示关键局限:即使Claude Opus 4.5等顶尖模型也存在显著差距,包括在模糊查询下难以选择合适计算器完成端到端工作流、基于SQL的迭代数据库交互表现不佳,以及明显不愿借助外部工具做数值计算。表现还跨临床领域差异显著。基于这些发现,我们开发CalcMate——一个融入场景规划与工具增强的微调模型,在开源模型中取得最先进表现。基准与代码见 https://github.com/SPIRAL-MED/MedMCP-Calc。
