论文
GLINT:用于细粒度放射学表示的稀疏门控视觉语言对齐
GLINT: Sparsely Gated Vision-Language Alignment for Fine-Grained Radiology Representations
摘要
通过利用临床工作流程中自然生成的图像报告对,放射学视觉语言模型 (VLM) 已成为一种可扩展的范例。然而,这种配对揭示了规模上的不匹配:每个发现仅占据图像的一小部分区域,但仅在全局图像报告级别提供监督。这提出了一个核心挑战:先前的方法将权重密集地分布在所有补丁上,而不是集中在与给定查询相关的稀疏子集上。为了解决这个问题,我们提出了 GLINT(门控语言图像对齐),这是一个显式模拟这种稀疏对应关系的框架。在对齐方面,我们引入了稀疏门对齐,这是一种新颖的架构,其中独立门嵌入空间上的 sigmoid 门仅激活与每个文本查询相关的补丁,从而强制执行显式稀疏性。在表示方面,我们添加了密集特征正则化,它将可训练编码器的中间特征锚定到冻结的自监督学习(SSL)教师,保留门所依赖的细粒度补丁特征。相同的方法适用于分别使用 DINOv3 和 V-JEPA 2.1 构建的 2D 胸部 X 射线 (CXR) 和 3D 胸部计算机断层扫描 (CT)。 GLINT 支持自由文本查询的零样本分类、定位和分割,据我们所知,GLINT 是第一个在没有掩模监督的情况下在 3D CT 体积上演示零样本分割的项目。值得注意的是,最明显的增益出现在零样本基础和分割上,其中需要稀疏的、特定于查询的本地化,这与我们的设计意图一致。在下游评估中,GLINT 在分类、报告生成和分段方面优于 SSL 编码器和医疗 VLM。