论文
Jolia:3D CT 对比学习的概念级视觉语言对齐
Jolia: Concept-Level Vision-Language Alignment for 3D CT Contrastive Learning
摘要
视觉语言对比预训练已成为 3D 医学基础模型的主要配方,利用临床实践中生成的大量配对扫描和报告。然而,医学图像通常跨越数十个器官,放射学报告比典型的自然图像说明要长得多,并且由多个结构化部分组成。 CLIP 式预训练通过将每种模态编码为单个全局标记来压缩此结构,但存在丢失重要细节的风险。我们引入了 ConQuer(概念查询),这是一种图像文本预训练方法,它通过一组本地化对齐(每个概念一个)来增强 CLIP 的全局对齐。 ConQuer 将报告拆分为特定于概念的部分,并学习交叉注意查询,这些查询汇集了匹配的图像特征,而无需使用任何分割掩模或空间监督。然后对每个概念独立应用对比学习。概念可以是语义定位的任何单位;在这里,它们是解剖区域,每个器官或身体区域一个查询。作为副产品,每个查询都会学习专注于其概念的注意力图,从而提供内置的空间可解释性。我们使用 ConQuer 来训练 Jolia,这是一种胸部和腹部 CT 的 3D CT 基础模型。 Jolia 在结果分类、报告生成和跨中心传输方面始终优于 CLIP 基线,并在多个公共基准中树立了新的最先进水平。 Jolia 的权重可在 https://huggingface.co/raidium/Jolia 上查看