论文
使用基础模型进行无标签核心集选择,以实现计算病理学中的高效注释
Label-Free Coreset Selection with Foundation Models for Efficient Annotation in Computational Pathology
摘要
计算病理学有潜力通过提高诊断和预后准确性来改善临床结果。然而,深度学习算法的开发和验证仍然需要带注释的数据,这是一个成本高昂的过程,涉及已经面临严重劳动力短缺的专家病理学家。目前,用于优化注释工作的现有核心集选择方法都依赖于根据自然图像基准调整的超参数,这些基准不会转移到组织病理学,并且在临床实践中使用起来很麻烦。在这项研究中,我们提出了 GCcore,一种新颖的无标签核心集选择方法,该方法将数据集的每个图像与任何病理学基础模型一起嵌入,并贪婪地选择共同最大化嵌入空间的全局覆盖范围的样本。所提出的方法为任何核心集大小的返回核心集的全局覆盖提供了下界保证,同时完全无超参数和确定性。我们展示了 GCcore 在 14 个基线上的卓越性能,包括跨 10 个任务和涵盖整个幻灯片图像分类、图块分类和组织分割的数据集的最先进方法,其中它在 6 个任务中排名第一,在 9 个任务中排名前三,同时还演示了现有方法如何根据其超参数设置最多移动 5 个排名位置。代码可在 https://github.com/OncoAI-ULBHUB/GCcore. 公开获取