论文
MedCalc-Pro:用LLM智能体求解复杂医学计算
MedCalc-Pro: Solving Complex Medical Calculations with LLM Agents
摘要
当前评估大语言模型(LLM)医学计算的基准大多基于简化设定——每个患者案例对应单个计算器且所需工具在查询中显式指定。但真实临床场景常需多计算器联合评估、嵌套量表计算、以及不直接指定目标计算器的模糊查询。为此——我们提出新医学计算基准MedCalc-Pro——覆盖三种渐进挑战的任务设定:单计算器、多计算器与嵌套计算器。MedCalc-Pro含2,268个真实临床案例——覆盖14个临床科室的77个医学计算器。同时——为解决既有框架与方法在复杂临床场景中的有限性能——我们进一步提出更通用的智能体框架:支持多工具选择与嵌套工具调用——同时经结构化验证与证据审查抑制参数错误传播。我们在开源、闭源与医疗专用LLM间开展系统比较——结果表明我们的框架在全部三种任务设定中取得最佳性能。本工作为在挑战性医学计算场景中评估与应用LLM提供新基准与新方法。
