论文

AlphaRAD:通过 $α$ 校正的二元交叉熵和分解的潜在监督在胸部放射学中进行零样本分类

AlphaRAD: Grounded Zero-Shot Classification in Chest Radiology via $α$-Corrected Binary Cross Entropy and Factorized Latent Supervision

模型训练预训练

摘要

视觉语言预训练模型(VLPM)为开放词汇胸部放射学理解提供了一条可扩展的途径,但有两个方面仍未得到充分探索:从医学报告中提取的结构化临床语义如何减少对比学习期间的批量噪声,以及如何设计跨模式融合以产生更忠实的空间基础而不增加复杂性。我们引入 AlphaRAD,通过两项贡献来抓住这些机会。首先,我们从 大语言模型 解析的医学报告中构建一个大规模的结构化医学概念空间进行训练,从而减轻批量学习噪声并消除对比学习中的启发式配对匹配,从而自然地将 AlphaRAD 定位为通过 $α$ 校正的二进制交叉熵训练的医学概念鉴别器。其次,我们提出了FLaS(分解潜在监督),这是一种极其简单但有效的跨模态特征融合模块,它将VLPM表示分解为独立的子空间,使用专用的对齐监督来增强空间基础的表现力,而无需引入额外的模型参数。通过广泛的实证验证,AlphaRAD 在不同的胸部放射学任务中显示出强大的零样本泛化能力。值得注意的是,它在 16 个分类基准上建立了最先进的平均性能,同时通过 7 个基础/短语基础和 3 个分割数据集的显着收益实现了个人最先进的结果。