论文

采用 2D 多模态 大语言模型 进行 3D CT 图像分析

Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis

摘要

3D医学图像分析在疾病诊断和治疗中具有重要意义。最近,多模态 大语言模型 (MLLM) 表现出了强大的感知能力、强大的跨模态对齐和有前途的泛化性。因此,它们在提高医学报告生成(MRG)和医学视觉问答(MVQA)的性能方面具有巨大潜力,这是临床场景中的两项重要任务。然而,由于 3D 医学图像的稀缺性,现有的 3D 医学 MLLM 面临着预训练视觉编码器不足的问题,并且无法为不同类型的任务提取定制的图像特征。在本文中,我们建议首先传输经过 2D 自然图像良好训练的 2D MLLM,以支持 3D 医学体积输入,同时重用其所有预先训练的参数。为了使视觉编码器能够为各种任务提取定制的图像特征,我们设计了一个文本引导分层MoE(TGH-MoE)框架,它可以在文本提示的指导下区分任务。此外,我们提出了一种两阶段训练策略来学习任务共享和特定于任务的图像特征。根据经验证明,我们的方法在 MRG 和 MVQA 任务中都优于现有的 3D 医学 MLLM。一旦本文被接受,我们的代码将被发布。