论文

SlideCheck:通过数据集分布指导病理学基础模型的自我监督预训练

SlideCheck: Guiding Self-Supervised Pretraining of Pathology Foundation Models via Dataset Distributions

模型训练合成数据

摘要

病理学基础模型是在 WSI 派生的大量补丁上进行预训练的,而数据构建过程中的监督通常是幻灯片级别的、稀疏的或异构的。这种不匹配使得理解和控制哪些生物模式进入预训练数据变得困难。我们提出了 SlideCheck,这是一种基于冷冻病理学基础模型补丁功能构建的轻量级预训练数据指导工具。 SlideCheck 不是充当独立的补丁诊断模型,而是提供明确的异常和恶性肿瘤评分,用于组织、过滤和审核病理学预训练数据。 SlideCheck 使用双头 MLP 分别对广泛的异常形态和恶性证据进行建模。正则化的特征空间评分器为补丁级证据估计提供了监督锚,而分数注意力协议将补丁分数与 WSI 级 MIL 注意力结合起来,以挖掘高置信度伪标签。然后使用相同的分数构建广泛阳性 ViT 预训练子集,如果异常或恶性肿瘤证据超过阈值,则选择补丁。实验表明,SlideCheck定义的数据分布影响自监督ViT预训练的下游行为,表明生物成分是病理学基础模型开发中的重要可控因素。精选的子集可以接近完整数据的性能,这表明明确评分的补丁池可以支持更高效和可审计的预训练数据构建。这些发现将 SlideCheck 定位为数据指导和审核层,用于将大型、无差异的补丁池转换为可控且可重用的预训练数据集。