论文

Mr3D-VL:多参数 3D 磁共振成像的通用视觉语言基础模型

Mr3D-VL: A generalist vision language foundation model for Multiparametric 3D Magnetic Resonance Imaging

模型架构Transformer

摘要

多参数磁共振成像(mpMRI)是脑肿瘤诊断和治疗的基石,但当前的人工智能模型面临着严重的局限性:它们缺乏自然语言交互和可解释性,阻碍了临床所需的空间信息集成和跨模式推理。主要挑战来自于不同模式之间显着的物理意义差异、扫描间隔导致的空间错位,以及神经胶质瘤分级等任务中对复杂多特征解释的需求。虽然视觉语言模型 (VLM) 在跨模态理解方面表现出了良好的前景,但现有方法主要侧重于 2D 图像建模,而忽略了 3D 体积空间的直接感知。尽管 3D VLM 已被提议用于 3D CT 成像中的报告生成和特征对齐,但 mpMRI 应用需要跨多种成像模式进行协作推理,而当前的解决方案无法满足这一要求。为了解决这个问题,我们引入了 Mr3D-VL,这是一种用于多参数 3D MRI 的专用视觉语言基础模型。它拥有 40 亿个参数,采用无监督的预训练共享 3D 编码器和 4D 旋转位置嵌入来实现双模态空间集成。其跨模态投影层采用多分辨率特征植入策略来增强跨分辨率的特征感知。实验结果表明,在文本生成任务中,较现有的 4B/7B/30B 特定领域和通用模型有显着改进,报告生成的 BERTScore 达到 0.856,问答准确率达到 0.713,多项选择准确率达到 0.912。