论文

基于量规的前沿语言模型在专家撰写临床推理任务上的受控比较

A rubric-based controlled comparison of frontier language models on expert-authored clinical reasoning tasks

模型评测基准与评测资源

摘要

多选医学基准日益饱和——而HealthBench等近期基于量规的评估表明开放式临床表现远未解决——其Hard子集最高分仍为32%。我们提出一个小型、刻意困难的评估数据集:五个临床医生撰写的临床场景、横跨四个专科(麻醉学、内科/家庭医学、急诊医学与产科)——每个配以从临床医生起草的黄金答案出发编写的原子化、加权、MECE量规(每任务25-62条标准;共184条)。我们评估三个前沿模型:GPT 5.4、Claude Opus 4.7与Gemini 3.1 Pro。平均量规通过率为0.47(Claude)、0.39(GPT)与0.37(Gemini)。核心发现是临床优先级的倒置:最高权重(权重5、关键)标准的通过率仅32.4-41.7%——而低风险权重1标准通过率达80-90%。108条关键(权重5)标准中有56条(52%)无任何模型满足。三个LLM自动评分者在552条已评标准上以92.8-94.7%复现专家的是/否标注。我们将其定位为方法与初步发现贡献:五个任务展示了可扩展、可辩护的管线——已可发展为大规模基准。