论文

Med-AR:用于长尾胸部 X 射线分类和不确定性感知评估的自回归视觉语言预训练

Med-AR: Autoregressive Vision-Language Pretraining for Long-Tailed Chest X-Ray Classification and Uncertainty-Aware Evaluation

模型训练预训练

摘要

长尾胸部 X 射线分类需要视觉表示,以捕捉常见异常和微妙、罕见的发现。我们提出 Med-AR-8B 和 Med-AR-2B,这是两种放射学原生自回归视觉语言模型,经过结构化报告、异常聚焦文本和区域注释进行预训练。我们使用通用的 ML-Decoder 分类头,针对对比、自监督和监督预训练编码器(包括 Med-CLIP、CheXFound、EVA-Base、ARK 和 BioViL-T)评估其视觉编码器向多标签分类的转移。为了评估细粒度识别,我们还为 MIMIC-CXR 和 CheXpert 构建了 LLM 扩展、报告衍生的标签集。在 PadChest、MIMIC-CXR 和 CheXpert 中,Med-AR-8B 在头部、中部和尾部发现的平均 AUROC 和 AUPRC 方面优于 Med-CLIP。在 MIMIC-CXR 上,它将尾部标签平均值 AUPRC 从 0.1033 增加到 0.1441。 Med-AR-2B 在 PadChest 上取得了最强的辨别结果。在更广泛的编码器比较中,Med-AR 变体在每个公共数据集的每个报告患病率组中实现了最高的平均 AUROC 和 AUPRC。在所有三个公共数据集上,两种 Med-AR 变体在风险覆盖曲线下的多余面积也比 Med-CLIP 更低,这表明在评估的协议下选择性预测性能有所提高。内部结果依赖于度量,Med-CLIP 在整体和尾部 AUPRC 以及选择性预测方面保留了优势。这些发现将 Med-AR 确立为在评估的公共基准上进行长尾胸部 X 射线分类的强大预训练方法,并证明了一起评估歧视和选择性预测的价值。