CANDOR:用于医学成像的冻结编码器中的机会校准邻域不一致
CANDOR: Chance-Calibrated Neighborhood Discordance in Frozen Encoders for Medical Imaging
摘要
基础编码器在大型图像语料库上预训练一次,然后在其权重冻结的情况下重新使用。每一个新任务都是通过训练一个小头脑所产生的特征来解决的。这种设置在医学成像中很常见,其中标记的病例很少,并且冻结的编码器可以在所有发现中重复使用。所有下游任务都取决于该固定特征空间中存在的类分离。编码器选择通常使用经过训练的下游头的接收器工作特性曲线 (AUROC) 下的面积。 AUROC 测量头部可以从特征中提取的预测信息,但它不测量冻结特征空间中的类分离。特征空间中位于负图像附近的正图像在任何 Lipschitz 头下都有一个有界的归一化边缘。机会校准邻域不一致(CANDOR)无需训练头部即可测量这种特征空间分离。对于正图像,它将以相同方式获取的图像中的 k 个最近的正标签邻居与 k 个最近的负标签邻居进行比较。不一致率 D 是相反标签邻居更接近的正例的比例。以相等的大小绘制 2 个候选集使得标签可以互换,因此标签无关的特征在没有模拟的情况下具有机会水平 D=1/2。我们将 CANDOR 应用于 22 个冻结编码器,处理来自 20 个公共数据集的 605,443 张图像,涵盖 7 个领域的 8 个二进制任务。对于每项任务,最佳编码器都低于 1/2。不一致的图像限制了该编码器上每个 Lipschitz 头的标准化边缘。显示真实标签并在 11 个编码器中进行选择的选择器将丢失率从 0.359 降低到 0.028。不一致与咬合保留相关,并且与预训练目标、参数计数、发布年份或发现大小无关。固定机会级别允许在训练任何下游头之前为冻结编码器计算 D。