论文

MedPMC:为基础模型扩展高保真医学多模态数据的系统框架

MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

模型训练合成数据

摘要

医学本质上是多模式的,需要临床医生综合不同数据流的信息。然而,多模式基础模型的发展受到大规模、高质量临床数据的限制。尽管 PubMed Central (PMC) 提供了专家创作的图像文本数据的补充来源,但现有的 PMC 衍生资源在保真度、再现性和临床验证方面仍然有限。我们推出 MedPMC,这是一个自动化、可持续更新的框架,可将许可的文献转化为医疗多模式模型的高保真基础设施。 MedPMC 应用于 610 万篇 PMC 文章,策划了 1100 万个医学图像-文本对。组件评估显示在初始筛选(F1 = 93.2)、多面板图形检测(F1 = 96.5)、图形分离(mAP = 89.8)、图注分离和对齐(F1 = 81.4;ROUGE-L = 85.3)和医学图形分类(F1 = 96.5)方面表现出色。由五名注释员(其中三名受过医学训练)进行手动审查,发现 MedPMC 图像中有 95.3% 具有医学相关性,而之前 PMC 衍生数据集中的这一比例为 19.7%。在涵盖 11 个专业的 26 个基准中,MedPMC 训练的 CLIP 式模型将平均零样本 AUC 比最强的架构匹配的生物医学 CLIP 基线提高了 7.1 个百分点,尽管使用的图像文本对数量还不到一半。作为多模态 大语言模型 中的视觉编码器,它在两个基准测试中将医学视觉问答能力提高了 1.9 和 16.9 个百分点。在 10,524 张耶鲁纽黑文医疗系统皮肤科照片中,Recall@5 将形态到图像检索提高了 11.7 个百分点。这些发现表明,高保真文献管理增强了跨基准和临床环境的医学多模式基础模型。我们公开发布框架、语料库、基准测试和预训练模型。