论文

Medmarks:用于医疗任务的综合开源 LLM 基准套件

Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks

模型评测基准与评测资源

摘要

由于基准饱和、数据可访问性有限以及相关任务覆盖范围不足,评估医疗应用的 大语言模型 (LLM) 仍然具有挑战性。现有的套件要么已经饱和,严重依赖于受限的数据集,要么缺乏全面的模型覆盖范围。我们推出 Medmarks,这是一个完全开源的评估套件,包含 30 个基准,涵盖问答、信息提取、医学计算和开放式临床推理。我们使用可验证的指标和 LLM-as-a-Judge 对 71 种配置的 61 个模型进行了系统评估。我们的结果表明,前沿推理模型(Gemini 3 Pro Preview、GPT-5.1 和 GPT-5.2)在两个基准测试中均实现了最高性能,大多数前沿专有模型比开放权重替代模型具有更高的词元效率,经过医学微调的模型优于其通用模型,并且该模型容易受到答案顺序偏差的影响(特别是较小的模型和 Grok 4)。我们的评估子集 (Medmarks-T) 可以直接用作强化学习环境,对 LLM 进行医学推理的后训练。代码可在 https://github.com/MedARC-AI/Medmarks 获取