论文

超越自然图像基础模型:眼科图像分析卫星预训练基准测试

Beyond Natural-Image Foundation Models: Benchmarking Satellite Pretraining for Ophthalmic Image Analysis

模型评测模型能力评测

摘要

视觉基础模型 (VFM) 已成为医学成像领域一种有前途的方法,产生了广泛适用的系统,可以有效地适应不同的成像模式、解剖区域和临床任务。然而,VFM 需要大量的训练数据,并且其在医学图像分析方面的进展受到有限的数据可用性、隐私问题和高昂的开发成本的限制。为了缓解这些限制,医学 VFM (MedVFM) 通常建立在对大量公开可用的自然图像进行预训练的通才模型的权重之上,从而为医疗任务适应引入了显着的分布变化。为了解决这个问题,我们建议将卫星图像作为 MedVFM 开发和基准测试的新型预训练领域,其动机是其与医疗数据更紧密的视觉一致性以及不受限制医疗数据集的隐私约束的影响。在多种眼科成像模式中,我们将在 4.93 亿张卫星图像上预训练的 DINOv3-SAT493m 与在 17 亿张自然图像上预训练的 DINOv3-LVD1689m 以及两个医学专家基线:DINOv3-RETFound 和 MAE-RETFound 进行比较。我们的实验表明,对于眼科任务,卫星图像是比自然图像更强的预训练源,特别是在面部血管丰富的模式上。在一些任务中,卫星预训练在高分辨率正面输入方面匹配或超过了医学专家,尽管没有使用任何医疗数据。