论文

从多分辨率细胞到十亿像素完整切片图像计算病理学基础模型

From Multi-Resolution Cells to Gigapixel Whole Slide Images Foundation Model for Computational Pathology

模型架构Transformer

摘要

Vision Transformer (ViTs) 及其分层变体在计算病理学 (CPath) 中取得了强大的性能。然而,大多数都是在单分辨率完整幻灯片图像 (WSI) 上进行预训练,限制了它们在任意分辨率上的泛化。十亿像素 WSI 本质上包含多个尺度的诊断模式,包括细胞形态、组织结构和全局背景,反映了病理学家检查 WSI 的方式。我们引入了多分辨率金字塔 Transformer (MRPT),这是一种分层聚合从细胞到组织和 WSI 级别的多分辨率信息的模型。 MRPT 采用具有生物学意义的连续跨分辨率注意力 (CCRA) 机制来捕获与尺度无关的交互,并通过跨分辨率对齐嵌入来强制多分辨率语义一致性,从而产生稳健且可泛化的 W​​SI 表示。 MRPT 在 624M 个斑块、240 万个区域和 36K WSI 上以多分辨率自监督方式进行预训练,学习丰富的从粗到细的组织病理学特征。对 34 个不同数据集的广泛实验表明,MRPT 在癌症亚型分类、组织表型和用于 WSI 理解的视觉问答 (VQA) 方面超越了最新的基础模型和多模态 大语言模型 (MLLM)。