论文

面向多模态大语言模型的医学视觉编码器预训练

Pretraining of Medical Visual Encoders Toward Multi-modal Large Language Models

模型训练预训练

摘要

多模态大语言模型(MLLM)通常复用经 CLIP 预训练的视觉编码器,尽管这些 ViT 的特征最终由自回归 LLM 消费。我们将这种失配称为语义接口鸿沟,并提出 MedMLIP 框架:通过冻结 LLM 的报告生成信号预训练视觉编码器,同时采用局部关系蒸馏(LRD)保持视觉图块之间的关系以避免视觉坍塌。我们在 IU-Xray 和 Open-PMC-300K 上预训练 MedMLIP,并在 VQA-RAD 和 SLAKE 上评估所得编码器。只迁移 ViT,而替换引导 LLM 和投影层,从而评估跨 LLM 的可迁移性。跨 LLM 迁移实验证明了面向自回归 LLM 接口预训练视觉编码器、同时保留更多细粒度视觉信息的价值。代码与预训练模型已公开。

面向多模态大语言模型的医学视觉编码器预训练:论文配图
图 1:MLLM 中有代表性的视觉—语言对齐范式:(a) 基于投影的 token 融合,(b) 基于查询的跨模态融合,(c) 逐层深度融合。尽管在视觉信息的映射与整合方式上各不相同,所有范式从根本上都取决于提供给 LLM 的视觉表示的质量。