论文
用于脑 MRI 插补和理解的统一多模态模型
Unified Multimodal Model for Brain MRI Imputation and Understanding
摘要
多模态 大语言模型 (MLLM) 在医学方面具有巨大潜力,因为它们继承了 LLM 的知识,并允许以自然语言集成、分析和解释多种数据模态。然而,医学 MLLM 领域受到一些不小的挑战的限制,特别是高质量训练数据的稀缺以及现实临床环境中数据缺失的频繁发生。在这里,我们提出了一种新颖的统一多模态模型 UniBrain,用于脑磁共振图像 (MRI) 分析。为了解决潜在缺失的脑 MRI 模式,我们采用统一的训练策略来执行联合成像模式插补和脑图像理解。在训练过程中,构建交错且描述丰富的数据流,以自回归方式训练模型,从而利用生成的多模态数据进行医学推理。引入自对准策略来利用密集图像嵌入来学习细粒度的解剖特征,而不需要详细的图像说明。此外,我们提出了一种动态隐藏状态机制来减轻长上下文多模态推理期间的暴露偏差。对多疾病脑部 MRI 数据集的大量实验表明,UniBrain 在不同程度的模态不完整性下实现了脑图像插补、理解和疾病诊断的高性能。