论文

学习关注点:组织病理学的自我监督多尺度 ViT

Learning Where to Focus: Self-Supervised Multi-Scale ViTs for Histopathology

模型架构Transformer

摘要

病理学家通过首先定位可疑组织,然后以更高的放大倍数进行检查来诊断疾病,而自监督视觉变换器 (ViT) 为每个图像区域分配相同的空间分辨率,尽管诊断证据稀疏且跨越多个生物尺度。最近的病理学基础模型通过扩展训练数据和模型容量显着提高了表示质量,但在很大程度上保留了统一的标记化。相反,我们研究是否可以通过学习在自我监督学习期间分配空间分辨率来改善病理学表征。为此,我们提出了 CRAFT(粗到细区域自适应特征标记化),这是一种基于 DINO 的框架,通过使用自监督注意力来选择性地细化信息区域,同时保留粗略上下文,以及鼓励互补的粗细表示的对称跨尺度正则化目标,来学习图像相关的混合尺度表示。在 CAMELYON16、TCGA-Lung 亚型分类和 TCGA-LUAD 生存预测中,CRAFT 始终优于可比规模的自监督方法,同时需要较低的推理计算。尽管仅使用在相对较小的病理数据集上训练的紧凑的 22M 参数骨干网,CRAFT 仍然具有竞争力,并且经常超越更大的病理学基础模型。