论文
CheXanatomy:胸部 X 光片的解剖感知视觉语言建模
CheXanatomy: Anatomy-Aware Vision-Language Modeling for Chest Radiographs
摘要
在大规模图像文本对上预训练的视觉语言模型(VLM)表现出强大的图像级理解,但主要针对全局对齐进行了优化,并且没有显式编码细粒度的解剖结构,限制了它们对分割等空间精确任务的适用性。我们引入了 CheXanatomy,这是一个通过自回归词元空间监督将显式解剖知识集成到预训练 VLM 中的框架。该模型不是添加特定于任务的解码器头,而是经过训练以通过下一个标记预测生成解剖分割掩模。为了实现可扩展的监督,我们从 CT 体积和前向投影 CT 分割标签合成真实的胸部 X 线照片,以获得解剖学上一致的 2D 掩模。我们根据 U-Net 基线评估合成和真实胸部 X 光照片的方法,包括模型尺度、输入分辨率和视觉编码器 微调 的消融。自回归解剖监督实现了与分布中的专用卷积模型相当的性能,并在域转移到真实 CXR 数据的情况下展示了改进的几何鲁棒性。此外,解剖学预训练模型在适应有限监督下的新定位任务时表现出更高的样本效率。更大的模型和更高的输入图像分辨率可以提高性能,而视觉编码器 微调 的效果有限。这些结果表明,将解剖结构直接嵌入到生成目标中可以促进基于空间的表示并支持解剖感知的医学视觉语言建模。