论文

MedMeta:LLM 综合医学研究荟萃分析结论的基准

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

模型评测基准与评测资源

摘要

大语言模型 (LLM) 具有饱和的标准医学基准来测试事实回忆,但它们执行高阶推理的能力(例如综合多个来源的证据)仍然严重不足。为了解决这一差距,我们引入了 MedMeta,这是第一个旨在评估 LLM 仅使用引用研究摘要从医学荟萃分析中生成结论的能力的基准。 MedMeta 包含来自 PubMed (2018--2025) 的 81 项荟萃分析,并使用两种不同的工作流程评估模型:带有 真值 摘要的检索增强生成 (Golden-RAG) 设置,以及依赖于内部知识的纯参数方法。我们的评估框架通过结构良好的分析进行验证,显示我们的 LLM 作为法官协议与人类专家评分高度一致,高 Pearson r 相关性 (0.81) 和 Bland-Altman 分析揭示了可忽略的系统偏差,从而将其确立为可扩展评估的可靠代理。我们的研究结果强调了信息基础的至关重要性:Golden-RAG 工作流程在各个模型中始终显着优于纯参数方法。相比之下,特定领域 微调 的好处是微乎其微的,并且在提供外部材料时基本上被抵消了。此外,压力测试表明,无论架构如何,所有模型都无法识别和拒绝否定证据,这凸显了当前 RAG 系统中的一个关键漏洞。值得注意的是,即使在理想的 RAG 条件下,当前的 LLM 也仅实现略高于平均水平的性能 (~2.7/5.0)。 MedMeta 为证据合成提供了一个具有挑战性的新基准,并表明对于临床应用,开发强大的 RAG 系统是比单独模型专业化更有前途的方向。