论文

全开源Meditron:面向临床LLM的可审计流水线

Fully Open Meditron: An Auditable Pipeline for Clinical LLMs

模型训练监督微调与指令调优

摘要

临床决策支持系统(CDSS)需要可审视、可审计的流水线,以支持严格且可复现的验证。然而,当前基于LLM的CDSS大体上仍不透明。大多数“开放”模型只是开放权重:发布参数,却隐瞒了决定模型行为的数据来源、数据整理流程与生成流水线。端到端公开完整训练栈的全开放(FO)模型,目前在医学领域尚不存在。我们提出全开源Meditron(Fully Open Meditron),首个构建LLM-CDSS的全开放流水线,包含经临床医生审计的训练语料、可复现的数据构建与训练框架,以及面向用法的评估协议。语料将八个公开医学问答数据集统一为规范化的对话格式,并以三个经临床医生审核的合成扩展扩充覆盖面:考试式问答、从46,469份临床实践指南导出的指南接地问答,以及临床病例小故事。该流水线强制执行全系统去污染、对教师生成结果的黄金标签重采样,以及由四名医生小组进行的端到端验证。我们采用LLM作为评判者的协议,在专家撰写的临床病例小故事上评估,并以204名人类评分者进行校准。我们将该配方应用于五个FO基座模型(Apertus-70B/8B-Instruct、OLMo-2-32B-SFT、EuroLLM-22B/9B-Instruct)。所有MeditronFO变体都优于其基座。Apertus-70B-MeditronFO在聚合医学基准上比其基座提升6.6分(47.2%到53.8%),确立了新的FO最优水平。Gemma-3-27B-MeditronFO在58.6%的LLM评判比较中优于MedGemma,并在HealthBench上胜出(58% vs 55.9%)。这些结果表明,全开放流水线可以在不牺牲可审计性与可复现性的前提下,达到最先进的领域专用性能。

全开源Meditron:面向临床LLM的可审计流水线:论文配图
图3:Fully Open Meditron各数据集按记录数的规模总览,全流程可审计。