论文
适用于多功能大脑 MR 图像任务的视觉指令微调语言模型
Visual Instruction-Finetuned Language Model for Versatile Brain MR Image Tasks
摘要
LLM 在语言推理方面表现出了卓越的能力,并且越来越擅长视觉语言任务。将图像词元集成到 Transformer 中可以实现直接视觉输入和输出,从而推进从图像到文本描述到文本到图像生成的研究。然而,简单的文本到图像生成的临床实用性有限。在医学成像中,诸如用于定位病理的图像分割或用于重建缺失序列的图像翻译等任务具有更大的临床重要性。尽管如此,将这些多样化的、临床相关的任务集成到一个单一的、多功能的语言模型中仍有待探索。我们的方法 LLaBIT(大语言模型 脑图像翻译)将 LLM 的视觉推理扩展到脑 MRI 领域中这些有临床意义的任务。为了减轻图像标记化中固有的空间信息丢失,我们采用了一种机制来重用图像编码器中的特征图,从而最大限度地减少数据退化。我们还使用 LLM 和严格的预定义指令生成文本数据,以增强脑 MRI 中有限的图像文本配对数据。我们在五个脑 MRI 数据集上全面评估了我们的方法,涉及四个不同的任务:报告生成、视觉问答、图像分割和图像翻译。我们的模型不仅在所有任务中表现出卓越的性能,而且在直接比较中优于专门的、特定于任务的模型,凸显了其有效性和多功能性