论文

LiveMedBench:一个采用自动化量规评估的无污染LLM医学基准

LiveMedBench: A Contamination-Free Medical Benchmark for LLMs with Automated Rubric Evaluation

模型评测基准与评测资源

摘要

在高风险临床场景中部署大语言模型(Large Language Model,LLM)需要严格且可靠的评估。然而,现有医学基准仍是静态的,存在两个关键局限:(1)数据污染,即测试集无意间泄漏进训练语料,导致性能估计被夸大;(2)时间错位,未能捕捉医学知识的快速演化。此外,当前针对开放式临床推理的评估指标往往依赖浅层的词汇重叠(如 ROUGE)或主观的 LLM-as-a-Judge 打分,两者都不足以验证临床正确性。为弥合这些缺口,我们提出 LiveMedBench,一个持续更新、无污染、基于量规(rubric)的基准,它每周从在线医疗社区采集真实临床病例,确保与模型训练数据在时间上严格分离。我们提出一个多智能体临床数据整理框架(Multi-Agent Clinical Curation Framework),用于过滤原始数据噪声,并依据循证医学原则校验临床完整性。在评估方面,我们开发了自动化量规评估框架(Automated Rubric-based Evaluation Framework),将医生回答分解为细粒度、病例特有的评分标准,与专家医生的对齐程度显著强于 LLM-as-a-Judge。截至目前,LiveMedBench 包含 2,756 个真实病例,覆盖 38 个医学专科和多种语言,并配有 16,702 条独特的评估标准。对 38 个 LLM 的大规模评估显示,表现最佳的模型也仅取得 39.2% 的成绩,且 84% 的模型在训练截止日期之后的病例上出现性能下降,证实了普遍存在的数据污染风险。错误分析进一步发现,情境化应用(而非事实性知识)是主要瓶颈,35-48% 的失败源于无法将医学知识适配到患者特定的约束条件上。

LiveMedBench:一个采用自动化量规评估的无污染LLM医学基准
图2:LiveMedBench框架概览。该流程包含五个阶段:(a) 从经过验证的在线社区持续挖掘双语临床数据;(b) 多智能体数据策展框架(Multi-Agent Curation Framework,含Screener、Validator与Controller),依据医学指南对数据进行结构化与验证;(c) 自动生成针对具体病例的评估细则;(d) 使用生成的评估细则对LLM进行客观评估;(e) 严格的人工质量保障,以确保与临床的一致性。