LiveMedBench:一个采用自动化量规评估的无污染LLM医学基准
LiveMedBench: A Contamination-Free Medical Benchmark for LLMs with Automated Rubric Evaluation
摘要
在高风险临床场景中部署大语言模型(Large Language Model,LLM)需要严格且可靠的评估。然而,现有医学基准仍是静态的,存在两个关键局限:(1)数据污染,即测试集无意间泄漏进训练语料,导致性能估计被夸大;(2)时间错位,未能捕捉医学知识的快速演化。此外,当前针对开放式临床推理的评估指标往往依赖浅层的词汇重叠(如 ROUGE)或主观的 LLM-as-a-Judge 打分,两者都不足以验证临床正确性。为弥合这些缺口,我们提出 LiveMedBench,一个持续更新、无污染、基于量规(rubric)的基准,它每周从在线医疗社区采集真实临床病例,确保与模型训练数据在时间上严格分离。我们提出一个多智能体临床数据整理框架(Multi-Agent Clinical Curation Framework),用于过滤原始数据噪声,并依据循证医学原则校验临床完整性。在评估方面,我们开发了自动化量规评估框架(Automated Rubric-based Evaluation Framework),将医生回答分解为细粒度、病例特有的评分标准,与专家医生的对齐程度显著强于 LLM-as-a-Judge。截至目前,LiveMedBench 包含 2,756 个真实病例,覆盖 38 个医学专科和多种语言,并配有 16,702 条独特的评估标准。对 38 个 LLM 的大规模评估显示,表现最佳的模型也仅取得 39.2% 的成绩,且 84% 的模型在训练截止日期之后的病例上出现性能下降,证实了普遍存在的数据污染风险。错误分析进一步发现,情境化应用(而非事实性知识)是主要瓶颈,35-48% 的失败源于无法将医学知识适配到患者特定的约束条件上。
