论文
面向多模态大语言模型的医学视觉编码器预训练
Pretraining of Medical Visual Encoders Toward Multi-modal Large Language Models
摘要
多模态大语言模型(MLLM)通常复用经 CLIP 预训练的视觉编码器,尽管这些 ViT 的特征最终由自回归 LLM 消费。我们将这种失配称为语义接口鸿沟,并提出 MedMLIP 框架:通过冻结 LLM 的报告生成信号预训练视觉编码器,同时采用局部关系蒸馏(LRD)保持视觉图块之间的关系以避免视觉坍塌。我们在 IU-Xray 和 Open-PMC-300K 上预训练 MedMLIP,并在 VQA-RAD 和 SLAKE 上评估所得编码器。只迁移 ViT,而替换引导 LLM 和投影层,从而评估跨 LLM 的可迁移性。跨 LLM 迁移实验证明了面向自回归 LLM 接口预训练视觉编码器、同时保留更多细粒度视觉信息的价值。代码与预训练模型已公开。
