论文

用于 TCGA 数据中图像检索的全幻灯片基础模型的验证

Validation of Whole-Slide Foundation Models for Image Retrieval in TCGA Data

模型评测模型能力评测

摘要

基础模型正在重塑计算组织病理学,但相对于强大的基于补丁和监督的聚合基线,它们对于全幻灯片图像检索的价值仍不清楚。我们使用患者级别的留一患者评估,对跨越 17 个器官的 9,387 个诊断幻灯片和来自癌症基因组图谱 (TCGA) 的 60 个诊断的 10 个管道进行了基准测试。方法包括四个预先训练的幻灯片基础模型、一个基于注意力的监督多实例学习 (ABMIL) 的补丁嵌入聚合器以及跨五个采样密度的补丁级检索。不同器官和诊断之间的性能差异比不同架构之间的差异更大。尽管滑动基础模型 TITAN 取得了最强的整体成绩,但其优势不大; ABMIL 和基于补丁的方法达到了可比的 Top-1 和 Top-3 精度,但没有模型始终占主导地位。形态独特的实体接近性能上限,而稀有、异质和密切相关的亚型仍然具有挑战性。错误分类与表现出已知的观察者间变异的器官一致,表明仅形态检索的内在上限。性能主要由补丁级特征表示驱动,幻灯片级聚合的好处有限,这表明聚合在许多设置中可能是不必要的。这些发现反对普遍最佳的架构,而是支持器官解析的基准测试、诊断感知或集成策略、更强的特征表示和多模式检索框架。值得注意的是,即使是最好的模型在 TCGA 上也只能达到 $\approx 68\% \pm 21\%$ 检索准确度,而某些亚型在所有方法中的准确度均为 $0\%$,这凸显了基于形态学表示的基本局限性以及在可靠的临床部署之前需要取得实质性进展。