论文
CheXmix:医学成像视觉语言模型的统一生成预训练
CheXmix: Unified Generative Pretraining for Vision Language Models in Medical Imaging
摘要
最近的医疗多模态基础模型是通过使用 LLaVA 式微调将 CLIP 预训练视觉编码器连接到 LLM 构建为多模态 LLM (MLLM)。这种两阶段、解耦的方法引入了一个可以扭曲视觉特征的投影层。这在医学成像中尤其重要,其中微妙的线索对于准确的诊断至关重要。相比之下,Chameleon 等早期融合生成方法通过在单个统一序列中处理图像和文本标记来消除投影瓶颈,从而实现利用语言模型的归纳先验的联合表示学习。我们提出了 CheXmix,这是一种统一的早期融合生成模型,在大量胸部 X 光数据和放射学报告上进行训练。我们通过引入两阶段多模态生成预训练策略来扩展 Chameleon 的自回归框架,该策略将屏蔽自编码器与 MLLM 的表征优势相结合。所得模型高度灵活,支持粗粒度和细粒度的判别性和生成性任务。我们的方法在所有掩蔽率方面均优于成熟的生成模型 6.0%,并且在 CheXpert 分类任务中以高图像掩蔽率的 AUROC 上优于 CheXagent 8.6%。我们进一步修复图像比纯文本生成模型好 51.0% 以上,并且在放射学报告生成的 GREEN 指标上比 CheXagent 高 45%。这些结果表明 CheXmix 可捕获广泛的胸部 X 射线任务中的细粒度信息。我们的代码位于:https://github.com/StanfordMIMI/CheXmix。