论文

超宽视场视网膜成像基础模型的表示迁移

Representation Transfer of Foundation Models for Ultra-Widefield Retinal Imaging

模型评测模型能力评测

摘要

尽管广泛采用基础模型作为医学成像的特征提取器,但对于不同的预训练策略如何影响学习表示到弱监督眼科成像任务的可迁移性,人们的了解相对较少。我们通过评估基于补丁的多实例学习 (MIL) 框架内的基础模型表示来研究超宽视野 (UWF) 视网膜成像中的这个问题,以对 UWF 图像进行疾病分类。我们将预训练的 Vision Transformer 编码器与监督式、掩模自动编码器 (MAE) 和自 蒸馏 目标进行比较,同时保持下游聚合架构不变。在对 ImageNet-1k 上预训练的 ViT-B 编码器进行的受控比较中,预训练目标的选择极大地影响了冻结表示传输,其中基于监督和自 蒸馏 的模型优于 MAE。在更大规模上预训练的当代 DINOv3 模型取得了最强的整体性能,五级糖尿病视网膜病变分级的二次加权 kappa 为 0.863,与 DINOv1 相当。注意力分析进一步揭示了与不同预训练表示相关的不同补丁聚合行为,而部分 微调 大大缩小了 MAE 的性能差距。这些发现表明,预训练策略会影响 MIL 内表示的可迁移性和补丁级证据的后续聚合,从而导致下游分类性能的差异。