论文

医学视觉基础模型的位置感知细粒度表示学习

Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models

模型训练预训练

摘要

细粒度的视觉表示对于医学图像分析至关重要,特别是当诊断相关证据微妙且空间局部化时。因此,基于 Transformer 的现代医学视觉编码器必须学习具有临床意义且空间一致的块级表示。如果没有这些特性,大型视觉语言模型(LVLM)就会在模糊的视觉基础上运行,从而限制了它们生成临床可靠且基于空间的响应的能力。然而,现有的医学视觉编码器训练策略很少实现这两个目标。图像-文本对齐主要在图像级别提供具有临床意义的监督,使诊断证据的空间定位受到弱约束。相比之下,自我监督学习促进了空间一致性,但缺乏区分视觉上相似但临床上不同的区域所需的语义监督。为了解决这一差距,我们提出了 LoFi,这是一种基于位置感知细粒度表示学习构建的医学视觉基础模型。 LoFi 在视觉定位和有定位依据的图像描述目标下使用轻量级 大语言模型 训练视觉编码器。由于这些目标需要根据临床文本预测位置,反之亦然,因此无需任何明确的补丁级正则化即可出现空间一致性。为了实现大规模训练,我们构建了 MedG,这是一个由 448 万个图像文本框三元组组成的大型医学基础数据集,由涵盖 7 种模式的 84 个数据集组成。在短语基础、视觉问答和扰动下基于区域的器官分类方面,LoFi 始终优于通用和医学视觉基础模型以及最先进的 LVLM。代码可在 https://github.com/myeongkyunkang/lofi-medg 获取。