论文

OpenMedQ:面向医学视觉语言模型的广泛开放预训练

OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models

模型训练预训练

摘要

我们提出了 OpenMedQ,这是一种在迄今为止最广泛的完全开放的医学组合上进行预训练的医学视觉语言模型:14 个数据集,总计约 335 万个预训练样本,涵盖病理学、放射学、显微镜学和纯文本临床 QA。 OpenMedQ 在 PathVQA 上达到最先进的 BLEU-1 (75.9),在多达 562B 参数(约大 80 倍)上击败 Med-PaLM M 变体,并与报告的最佳 VQA-MED BLEU-1 (64.5) 相匹配。其视觉编码器在相同的下游配方下转移到 8 个未见过的医学分类基准,在 BiomedCLIP (0.745)、PMC-CLIP (0.745)、PubMedCLIP (0.746) 和从头开始的基线 (0.616) 中获得最高的平均宏 F1 (0.757)。我们发布了代码,并公开了一个交互式演示,作为社区的可复制基准。