论文

像放射科医生一样观察:胸部 X 光检查的情境和注视引导视觉语言预训练

Seeing Like Radiologists: Context- and Gaze-Guided Vision-Language Pretraining for Chest X-rays

模型训练预训练

摘要

尽管医学视觉语言预训练最近取得了进展,但现有模型仍然难以捕捉诊断工作流程:射线照片通常被视为与上下文无关的图像,而放射科医生的凝视(视觉推理的关键线索)在很大程度上仍然没有被现有方法充分探索。这些限制阻碍了疾病特定模式的建模并削弱了跨模式对齐。为了弥补这一差距,我们引入了 CoGaze,一种用于胸部 X 光检查的上下文和凝视引导的视觉语言预训练框架。我们首先提出了一种上下文注入的视觉编码器,该编码器可以模拟放射科医生如何整合临床上下文(包括患者病史、症状和诊断意图)来指导诊断推理。然后,我们提出了一种多级监督范式,该范式(1)通过混合正对比学习强制模内和模间语义对齐,(2)通过疾病感知跨模态表示学习注入诊断先验,以及(3)利用放射科医生的凝视作为概率先验来引导对诊断显着区域的注意力。大量实验表明,CoGaze 在各种任务中始终优于最先进的方法,在自由文本和结构化报告生成方面实现了高达 +2.0% CheXbertF1 和 +1.2% BLEU2,在零样本分类方面实现了 +23.2% AUROC,在图像文本检索方面实现了 +12.2% Precision@1。代码可在 https://github.com/mk-runner/CoGaze 获取。