论文
当数据稀缺时,自我监督预训练最有助于视网膜疾病进展建模
Self-supervised Pre-training Helps Retinal Disease Progression Modelling Most When Data Is Scarce
摘要
模拟疾病如何随时间进展需要纵向成像队列,这些数据稀缺且规模较小,而横截面数据(每个参与者一张图像)却很丰富。对此类数据进行自我监督预训练提供了一种弥补这一差距的方法,但尚不清楚哪种策略最能支持进展建模,或者该答案如何取决于标记的纵向数据量。我们针对年龄相关性黄斑变性 (AMD) 进行了研究,在大横截面 NAKO 队列上预训练编码器,并在纵向 AREDS 数据集上预测晚期 AMD 的时间。我们将内部自监督编码器与通用 (DINOv2) 和特定领域 (RETFound) 基础模型进行比较,跨越对比、屏蔽自动编码和自蒸馏目标,在冻结和微调协议下,以及从 100 到 32,250 个示例的标记训练集。哪种模型表现最好取决于编码器的使用方式。当编码器被冻结并且标签很少时(纵向队列的典型情况),预训练的表示可以从数百个标记样本中达到临床上合理的区分,而从头开始训练的模型则不能;这种优势在微调下会逐渐消失。迁移是由自我监督目标决定的,而不是语料库规模或领域匹配,因此在适度的横截面队列上预训练的编码器可以匹配或超过更大的领域内基础模型。总之,这些结果为构建纵向数据稀缺的进展模型提供了实用的方法:带有轻量级生存头的冷冻自监督编码器。